Začněte nyníZačněte zdarma

Anatomie modelu strojového učení

Teď si prohloubíš pochopení toho, jak data ovlivňují výkon modelu. Budeš pracovat s datasetem rezervací Airbnb (soubor booking.csv). Dataset je vhodný pro klasifikační úlohy – konkrétně pro předpovídání, zda někdo rezervaci zruší. Obsahuje několik numerických i kategorických sloupců. Dataset rozdělíš do tří vzájemně nezávislých vzorků – train_A.csv, train_B.csv a test.csv – pomocí skriptu split_dataset.py. Pro každý trénovací dataset pak spustíš pipeline zpracování dat a trénování modelu, abys natrénoval/a klasifikátor Random Forest a otestoval/a jeho výkon na testovací sadě pomocí model_training.py. Hyperparametry definované v params.json jsou v obou spuštěních stejné.

Pythonové skripty jsou navrženy tak, aby přijímaly argumenty příkazové řádky a spouštěly se přes shell. Klidně si je prozkoumej, ať lépe pochopíš, jak fungují.

Toto cvičení je součástí kurzu

Úvod do verzování dat s DVC

Zobrazit kurz

Interaktivní praktické cvičení

Proměňte teorii v praxi s jedním z našich interaktivních cvičení

Začít cvičení