Anatomia unui model de învățare automată
Acum vei consolida înțelegerea modului în care datele influențează performanța unui model. Vei lucra cu setul de date Airbnb pentru rezervări (fișierul booking.csv). Setul de date este potrivit pentru sarcini de clasificare, mai exact pentru a prezice dacă o persoană va anula sau nu o rezervare. Conține mai multe coloane numerice și categorice.
Vei împărți setul de date furnizat în trei eșantioane mutual exclusive – train_A.csv, train_B.csv și test.csv – folosind scriptul split_dataset.py. Apoi, pentru fiecare set de antrenament, vei rula pipeline-ul de procesare a datelor și de antrenare a modelului, pentru a antrena un model Random Forest Classifier și a-i testa performanța pe setul de testare, folosind model_training.py. Hiperparametrii definiți în params.json sunt aceiași în ambele rulări.
Scripturile Python sunt concepute să accepte argumente din linia de comandă și să ruleze prin shell. Nu ezita să le explorezi pentru a-ți îmbogăți înțelegerea.
Acest exercițiu face parte din cursul
Introducere în versionarea datelor cu DVC
Exercițiu interactiv practic
Transformă teoria în practică cu unul dintre exercițiile noastre interactive
Începe exercițiul