Anatomia modelu uczenia maszynowego
Teraz utrwalisz wiedzę na temat tego, jak dane wpływają na wydajność modelu. Będziesz pracować ze zbiorem danych Airbnb dotyczącym rezerwacji (plik booking.csv). Zbiór nadaje się do zadań klasyfikacji – konkretnie do przewidywania, czy ktoś anuluje rezerwację. Zawiera kilka kolumn numerycznych i kategorycznych.
Podzielisz dostarczony zbiór danych na trzy rozłączne próbki – train_A.csv, train_B.csv i test.csv – używając skryptu split_dataset.py. Następnie dla każdego zbioru treningowego uruchomisz potok przetwarzania danych i trenowania modelu, aby wytrenować klasyfikator Random Forest i sprawdzić jego wydajność na zbiorze testowym za pomocą model_training.py. Hiperparametry zdefiniowane w params.json są takie same w obu przebiegach.
Skrypty Python są przystosowane do przyjmowania argumentów wiersza poleceń i uruchamiania przez powłokę. Możesz swobodnie je przeglądać, aby lepiej zrozumieć ich działanie.
To ćwiczenie jest częścią kursu
Wprowadzenie do wersjonowania danych z DVC
Interaktywne ćwiczenie praktyczne
Przekształć teorię w praktykę dzięki jednemu z naszych interaktywnych ćwiczeń
Rozpocznij ćwiczenie