ÎncepețiÎncepe gratuit

Anatomia unui model de învățare automată

Acum vei consolida înțelegerea modului în care datele influențează performanța unui model. Vei lucra cu setul de date Airbnb pentru rezervări (fișierul booking.csv). Setul de date este potrivit pentru sarcini de clasificare, mai exact pentru a prezice dacă o persoană va anula sau nu o rezervare. Conține mai multe coloane numerice și categorice. Vei împărți setul de date furnizat în trei eșantioane mutual exclusive – train_A.csv, train_B.csv și test.csv – folosind scriptul split_dataset.py. Apoi, pentru fiecare set de antrenament, vei rula pipeline-ul de procesare a datelor și de antrenare a modelului, pentru a antrena un model Random Forest Classifier și a-i testa performanța pe setul de testare, folosind model_training.py. Hiperparametrii definiți în params.json sunt aceiași în ambele rulări.

Scripturile Python sunt concepute să accepte argumente din linia de comandă și să ruleze prin shell. Nu ezita să le explorezi pentru a-ți îmbogăți înțelegerea.

Acest exercițiu face parte din cursul

Introducere în versionarea datelor cu DVC

Vezi cursul

Exercițiu interactiv practic

Transformă teoria în practică cu unul dintre exercițiile noastre interactive

Începe exercițiul