Anatomi hos en maskininlärningsmodell
Nu får du befästa din förståelse för hur data påverkar modellens prestanda. Du kommer att arbeta med Airbnb-bokningsdatasetet (i filen booking.csv). Datasetet lämpar sig för klassificeringsuppgifter där målet är att förutsäga om en bokning kommer att avbokas. Det innehåller flera numeriska och kategoriska kolumner.
Du delar upp datasetet i tre ömsesidigt uteslutande urval – train_A.csv, train_B.csv och test.csv – med hjälp av skriptet split_dataset.py. Sedan kör du databearbetnings- och modellträningspipelinen för varje träningsdataset med model_training.py för att träna en Random Forest-klassificeringsmodell och utvärdera dess prestanda på testdatasetet. Hyperparametrarna som definieras i params.json är desamma i båda körningarna.
Python-skripten är utformade för att ta emot kommandoradsargument och köras via skal. Utforska gärna skripten för att fördjupa din förståelse.
Den här övningen är en del av kursen
Introduktion till dataversionshantering med DVC
Interaktiv övning med praktiskt arbete
Gör teori till handling med en av våra interaktiva övningar
Starta övningen