Анатомія моделі машинного навчання
Тепер ви закріпите розуміння того, як дані впливають на якість моделі. Ви працюватимете з набором даних про бронювання Airbnb (файл booking.csv). Цей набір даних підходить для задач класифікації, щоб передбачити, чи хтось скасує бронювання. Він містить кілька числових і категоріальних стовпців.
Ви розіб'єте наданий набір даних на три взаємовиключні вибірки — train_A.csv, train_B.csv та test.csv — за допомогою скрипта split_dataset.py. Далі для кожної тренувальної вибірки ви запустите конвеєр обробки даних і навчання моделі, щоб натренувати модель Random Forest Classifier і перевірити її продуктивність на тестовій вибірці за допомогою model_training.py. Гіперпараметри, визначені в params.json, однакові в обох запусках.
Скрипти Python приймають аргументи командного рядка і запускаються через оболонку. За бажанням перегляньте ці скрипти, щоб поглибити розуміння.
Ця вправа є частиною курсу
Вступ до керування версіями даних із DVC
Практична інтерактивна вправа
Перетворіть теорію на практику за допомогою однієї з наших інтерактивних вправ
Почати вправу