НачатьНачать бесплатно

Разбивка на обучающую и тестовую выборки

В этой главе вы продолжите работу с набором данных ANSUR. Прежде чем строить модель, нужно решить, какой признак вы хотите предсказывать. В данном случае задача — предсказать пол.

Вам потребуется извлечь из набора данных столбец с этим признаком, а затем разбить данные на обучающую и тестовую выборки. Обучающая выборка будет использоваться для обучения модели, а тестовая — для оценки её качества на новых данных.

ansur_df уже загружен и доступен вам.

Это упражнение является частью курса

Снижение размерности в Python

Посмотреть курс

Инструкции к упражнению

  • Импортируйте функцию train_test_split из sklearn.model_selection.
  • Присвойте столбец 'Gender' переменной y.
  • Удалите столбец 'Gender' из DataFrame и сохраните результат в переменную X.
  • Установите размер тестовой выборки равным 30%, чтобы выполнить разбивку: 70% — обучающие данные, 30% — тестовые.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Import train_test_split()
from ____.____ import ____

# Select the Gender column as the feature to be predicted (y)
y = ansur_df[____]

# Remove the Gender column to create the training data
X = ansur_df.____(____, ____)

# Perform a 70% train and 30% test data split
X_train, X_test, y_train, y_test = ____(X, y, ____=____)

print(f"{X_test.shape[0]} rows in test set vs. {X_train.shape[0]} in training set, {X_test.shape[1]} Features.")
Редактировать и запускать код