Разделение данных на обучающую и тестовую выборки
Теперь вы готовы построить полноценную модель машинного обучения, выполнив несколько простых шагов! В следующих главах вы изучите тонкости моделирования подробнее, а пока отработаете и закрепите ключевые этапы.
Независимые признаки загружены в виде DataFrame из pandas под именем X, а зависимые значения — в виде Series из pandas под именем Y.
Функция train_test_split из библиотеки sklearn уже импортирована. Создайте обучающую и тестовую выборки, а затем убедитесь, что данные разделены корректно.
Это упражнение является частью курса
Машинное обучение для маркетинга на Python
Инструкции к упражнению
- Разделите
XиYна обучающую и тестовую выборки, выделив 25% данных для тестирования. - Убедитесь, что обучающая выборка содержит ровно 75% исходных данных.
- Убедитесь, что тестовая выборка содержит ровно 25% исходных данных.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Split X and Y into training and testing datasets
train_X, test_X, train_Y, test_Y = ___(___, ___, test_size=0.___)
# Ensure training dataset has only 75% of original X data
print(___.shape[0] / X.shape[0])
# Ensure testing dataset has only 25% of original X data
print(___.shape[0] / ___.shape[0])