Розбийте дані на тренувальну та тестову вибірки
Тепер ви готові побудувати наскрізну модель машинного навчання, виконавши кілька простих кроків! Ви детальніше розглянете нюанси моделювання в наступних розділах, а зараз потренуєтеся та зрозумієте ключові етапи.
Незалежні ознаки вже завантажено для вас у датафрейм pandas під назвою X, а залежні значення — у Series pandas під назвою Y.
Також із бібліотеки sklearn імпортовано функцію train_test_split. Ви створите тренувальний і тестовий набори даних, а потім перевірите, що дані було поділено коректно.
Ця вправа є частиною курсу
Machine Learning для маркетингу в Python
Інструкції до вправи
- Розбийте
XіYна тренувальну та тестову вибірки так, щоб 25% даних потрапило до тесту. - Переконайтеся, що тренувальна вибірка містить лише 75% початкових даних.
- Переконайтеся, що тестова вибірка містить лише 25% початкових даних.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Split X and Y into training and testing datasets
train_X, test_X, train_Y, test_Y = ___(___, ___, test_size=0.___)
# Ensure training dataset has only 75% of original X data
print(___.shape[0] / X.shape[0])
# Ensure testing dataset has only 25% of original X data
print(___.shape[0] / ___.shape[0])