Anatomie modelu strojového učení
Teď si prohloubíš pochopení toho, jak data ovlivňují výkon modelu. Budeš pracovat s datasetem rezervací Airbnb (soubor booking.csv). Dataset je vhodný pro klasifikační úlohy – konkrétně pro předpovídání, zda někdo rezervaci zruší. Obsahuje několik numerických i kategorických sloupců.
Dataset rozdělíš do tří vzájemně nezávislých vzorků – train_A.csv, train_B.csv a test.csv – pomocí skriptu split_dataset.py. Pro každý trénovací dataset pak spustíš pipeline zpracování dat a trénování modelu, abys natrénoval/a klasifikátor Random Forest a otestoval/a jeho výkon na testovací sadě pomocí model_training.py. Hyperparametry definované v params.json jsou v obou spuštěních stejné.
Pythonové skripty jsou navrženy tak, aby přijímaly argumenty příkazové řádky a spouštěly se přes shell. Klidně si je prozkoumej, ať lépe pochopíš, jak fungují.
Toto cvičení je součástí kurzu
Úvod do verzování dat s DVC
Interaktivní praktické cvičení
Proměňte teorii v praxi s jedním z našich interaktivních cvičení
Začít cvičení