Анатомия модели машинного обучения
Теперь вы закрепите понимание того, как данные влияют на качество модели. Вы будете работать с набором данных о бронированиях Airbnb (файл booking.csv). Этот набор данных подходит для задач классификации: с его помощью можно предсказать, отменит ли пользователь бронирование. Он содержит несколько числовых и категориальных столбцов.
Вы разобьёте предоставленный набор данных на три непересекающиеся выборки — train_A.csv, train_B.csv и test.csv — с помощью скрипта split_dataset.py. Затем для каждой обучающей выборки вы запустите конвейер обработки данных и обучения модели, чтобы обучить модель случайного леса (Random Forest Classifier) и проверить её качество на тестовой выборке с помощью model_training.py. Гиперпараметры, заданные в params.json, одинаковы для обоих запусков.
Скрипты Python принимают аргументы командной строки и запускаются через оболочку. Изучите их, чтобы лучше разобраться в происходящем.
Это упражнение является частью курса
Введение в версионирование данных с DVC
Практическое интерактивное упражнение
Превратите теорию в практику с помощью одного из наших интерактивных упражнений
Начать упражнение