ПочатиПочніть безкоштовно

Train - test split

У цьому розділі ви й далі працюватимете з набором даних ANSUR. Перш ніж будувати модель на вашому наборі даних, слід визначити, яку ознаку ви хочете передбачати. У цьому випадку ви намагаєтеся передбачити стать.

Потрібно витягти стовпець з цією ознакою з набору даних, а потім розбити дані на тренувальну та тестову вибірки. Тренувальна вибірка буде використана для навчання моделі, а тестова — для перевірки її роботи на невидимих даних.

ansur_df уже завантажено для вас.

Ця вправа є частиною курсу

Зменшення розмірності в Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте функцію train_test_split із sklearn.model_selection.
  • Призначте стовпець 'Gender' змінній y.
  • Видаліть стовпець 'Gender' з датафрейму та призначте результат змінній X.
  • Встановіть розмір тестової вибірки 30%, щоб виконати розбиття: 70% тренувальні та 30% тестові дані.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import train_test_split()
from ____.____ import ____

# Select the Gender column as the feature to be predicted (y)
y = ansur_df[____]

# Remove the Gender column to create the training data
X = ansur_df.____(____, ____)

# Perform a 70% train and 30% test data split
X_train, X_test, y_train, y_test = ____(X, y, ____=____)

print(f"{X_test.shape[0]} rows in test set vs. {X_train.shape[0]} in training set, {X_test.shape[1]} Features.")
Редагувати та запускати код