ПочатиПочніть безкоштовно

Поділ даних про співробітників

Перенавчання набору даних — поширена проблема в аналітиці. Це трапляється, коли модель добре працює на даних, на яких її навчали, але не узагальнює результати за їх межами.

Щоб забезпечити узагальнюваність моделі, застосовують поділ на тренувальну й тестову вибірки: ви розробляєте модель на тренувальній вибірці, а потім перевіряєте її на тестовій.

У цій вправі ви поділите target і features на тренувальний і тестовий набори у співвідношенні 75%/25% відповідно.

Ця вправа є частиною курсу

HR Analytics: прогнозування плинності персоналу в Python

Переглянути курс

Інструкції до вправи

  • Імпортуйте train_test_split з модуля sklearn.model_selection
  • Використайте train_test_split() для поділу вашого набору даних на тренувальний і тестовий
  • Віднесіть 25% ваших спостережень до тестового набору

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

# Import the function for splitting dataset into train and test
from sklearn.model_selection import ____

# Use that function to create the splits both for target and for features
# Set the test sample to be 25% of your observations
target_train, target_test, features_train, features_test = ____(target,features,____=0.25,random_state=42)
Редагувати та запускати код