НачатьНачать бесплатно

Разделение данных на обучающую и тестовую выборки

Теперь вы готовы построить полноценную модель машинного обучения, выполнив несколько простых шагов! В следующих главах вы изучите тонкости моделирования подробнее, а пока отработаете и закрепите ключевые этапы.

Независимые признаки загружены в виде DataFrame из pandas под именем X, а зависимые значения — в виде Series из pandas под именем Y.

Функция train_test_split из библиотеки sklearn уже импортирована. Создайте обучающую и тестовую выборки, а затем убедитесь, что данные разделены корректно.

Это упражнение является частью курса

Машинное обучение для маркетинга на Python

Посмотреть курс

Инструкции к упражнению

  • Разделите X и Y на обучающую и тестовую выборки, выделив 25% данных для тестирования.
  • Убедитесь, что обучающая выборка содержит ровно 75% исходных данных.
  • Убедитесь, что тестовая выборка содержит ровно 25% исходных данных.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Split X and Y into training and testing datasets
train_X, test_X, train_Y, test_Y = ___(___, ___, test_size=0.___)

# Ensure training dataset has only 75% of original X data
print(___.shape[0] / X.shape[0])

# Ensure testing dataset has only 25% of original X data
print(___.shape[0] / ___.shape[0])
Редактировать и запускать код