ПочатиПочніть безкоштовно

Анатомія моделі машинного навчання

Тепер ви закріпите розуміння того, як дані впливають на якість моделі. Ви працюватимете з набором даних про бронювання Airbnb (файл booking.csv). Цей набір даних підходить для задач класифікації, щоб передбачити, чи хтось скасує бронювання. Він містить кілька числових і категоріальних стовпців. Ви розіб'єте наданий набір даних на три взаємовиключні вибірки — train_A.csv, train_B.csv та test.csv — за допомогою скрипта split_dataset.py. Далі для кожної тренувальної вибірки ви запустите конвеєр обробки даних і навчання моделі, щоб натренувати модель Random Forest Classifier і перевірити її продуктивність на тестовій вибірці за допомогою model_training.py. Гіперпараметри, визначені в params.json, однакові в обох запусках.

Скрипти Python приймають аргументи командного рядка і запускаються через оболонку. За бажанням перегляньте ці скрипти, щоб поглибити розуміння.

Ця вправа є частиною курсу

Вступ до керування версіями даних із DVC

Переглянути курс

Практична інтерактивна вправа

Перетворіть теорію на практику за допомогою однієї з наших інтерактивних вправ

Почати вправу