Podział danych pracowników
Przeuczenie modelu (overfitting) to częsty problem w analityce. Pojawia się wtedy, gdy model dobrze radzi sobie na danych, na których był trenowany, ale nie generalizuje na nowych danych.
Podział na zbiór treningowy i testowy pozwala sprawdzić, czy model działa dobrze poza danymi treningowymi: budujesz model na zbiorze treningowym, a następnie weryfikujesz jego działanie na zbiorze testowym.
W tym ćwiczeniu podzielisz zmienne target oraz features na zbiory treningowy i testowy w proporcji 75%/25%.
To ćwiczenie jest częścią kursu
HR Analytics: Przewidywanie rotacji pracowników w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj
train_test_splitz modułusklearn.model_selection - Użyj funkcji
train_test_split(), aby podzielić zbiór danych na część treningową i testową - Przypisz 25% obserwacji do zbioru testowego
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import the function for splitting dataset into train and test
from sklearn.model_selection import ____
# Use that function to create the splits both for target and for features
# Set the test sample to be 25% of your observations
target_train, target_test, features_train, features_test = ____(target,features,____=0.25,random_state=42)