Dela upp medarbetardata
Överanpassning av datamängden är ett vanligt problem inom analys. Det uppstår när en modell fungerar väl på den datamängd den tränades på, men misslyckas med att generalisera till nya data.
En uppdelning i tränings- och testdata används för att säkerställa att modellen generaliserar: du tränar modellen på träningsdata och utvärderar den sedan på testdata.
I den här övningen delar du upp både target och features i tränings- och testmängder med förhållandet 75%/25%.
Den här övningen är en del av kursen
HR-analys: Förutsäg personalomsättning i Python
Övningsinstruktioner
- Importera
train_test_splitfrån modulensklearn.model_selection - Använd
train_test_split()för att dela upp din datamängd i tränings- och testdata - Tilldela 25% av dina observationer till testmängden
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import the function for splitting dataset into train and test
from sklearn.model_selection import ____
# Use that function to create the splits both for target and for features
# Set the test sample to be 25% of your observations
target_train, target_test, features_train, features_test = ____(target,features,____=0.25,random_state=42)