Разбивка на обучающую и тестовую выборки
В этой главе вы продолжите работу с набором данных ANSUR. Прежде чем строить модель, нужно решить, какой признак вы хотите предсказывать. В данном случае задача — предсказать пол.
Вам потребуется извлечь из набора данных столбец с этим признаком, а затем разбить данные на обучающую и тестовую выборки. Обучающая выборка будет использоваться для обучения модели, а тестовая — для оценки её качества на новых данных.
ansur_df уже загружен и доступен вам.
Это упражнение является частью курса
Снижение размерности в Python
Инструкции к упражнению
- Импортируйте функцию
train_test_splitизsklearn.model_selection. - Присвойте столбец
'Gender'переменной y. - Удалите столбец
'Gender'из DataFrame и сохраните результат в переменнуюX. - Установите размер тестовой выборки равным 30%, чтобы выполнить разбивку: 70% — обучающие данные, 30% — тестовые.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Import train_test_split()
from ____.____ import ____
# Select the Gender column as the feature to be predicted (y)
y = ansur_df[____]
# Remove the Gender column to create the training data
X = ansur_df.____(____, ____)
# Perform a 70% train and 30% test data split
X_train, X_test, y_train, y_test = ____(X, y, ____=____)
print(f"{X_test.shape[0]} rows in test set vs. {X_train.shape[0]} in training set, {X_test.shape[1]} Features.")