Train - test split
У цьому розділі ви й далі працюватимете з набором даних ANSUR. Перш ніж будувати модель на вашому наборі даних, слід визначити, яку ознаку ви хочете передбачати. У цьому випадку ви намагаєтеся передбачити стать.
Потрібно витягти стовпець з цією ознакою з набору даних, а потім розбити дані на тренувальну та тестову вибірки. Тренувальна вибірка буде використана для навчання моделі, а тестова — для перевірки її роботи на невидимих даних.
ansur_df уже завантажено для вас.
Ця вправа є частиною курсу
Зменшення розмірності в Python
Інструкції до вправи
- Імпортуйте функцію
train_test_splitізsklearn.model_selection. - Призначте стовпець
'Gender'змінній y. - Видаліть стовпець
'Gender'з датафрейму та призначте результат зміннійX. - Встановіть розмір тестової вибірки 30%, щоб виконати розбиття: 70% тренувальні та 30% тестові дані.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Import train_test_split()
from ____.____ import ____
# Select the Gender column as the feature to be predicted (y)
y = ansur_df[____]
# Remove the Gender column to create the training data
X = ansur_df.____(____, ____)
# Perform a 70% train and 30% test data split
X_train, X_test, y_train, y_test = ____(X, y, ____=____)
print(f"{X_test.shape[0]} rows in test set vs. {X_train.shape[0]} in training set, {X_test.shape[1]} Features.")