Zacznij terazZacznij za darmo

Podział danych pracowników

Przeuczenie modelu (overfitting) to częsty problem w analityce. Pojawia się wtedy, gdy model dobrze radzi sobie na danych, na których był trenowany, ale nie generalizuje na nowych danych.

Podział na zbiór treningowy i testowy pozwala sprawdzić, czy model działa dobrze poza danymi treningowymi: budujesz model na zbiorze treningowym, a następnie weryfikujesz jego działanie na zbiorze testowym.

W tym ćwiczeniu podzielisz zmienne target oraz features na zbiory treningowy i testowy w proporcji 75%/25%.

To ćwiczenie jest częścią kursu

HR Analytics: Przewidywanie rotacji pracowników w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj train_test_split z modułu sklearn.model_selection
  • Użyj funkcji train_test_split(), aby podzielić zbiór danych na część treningową i testową
  • Przypisz 25% obserwacji do zbioru testowego

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import the function for splitting dataset into train and test
from sklearn.model_selection import ____

# Use that function to create the splits both for target and for features
# Set the test sample to be 25% of your observations
target_train, target_test, features_train, features_test = ____(target,features,____=0.25,random_state=42)
Edytuj i uruchom kod