Kom igångKom igång gratis

Dela upp medarbetardata

Överanpassning av datamängden är ett vanligt problem inom analys. Det uppstår när en modell fungerar väl på den datamängd den tränades på, men misslyckas med att generalisera till nya data.

En uppdelning i tränings- och testdata används för att säkerställa att modellen generaliserar: du tränar modellen på träningsdata och utvärderar den sedan på testdata.

I den här övningen delar du upp både target och features i tränings- och testmängder med förhållandet 75%/25%.

Den här övningen är en del av kursen

HR-analys: Förutsäg personalomsättning i Python

Visa kurs

Övningsinstruktioner

  • Importera train_test_split från modulen sklearn.model_selection
  • Använd train_test_split() för att dela upp din datamängd i tränings- och testdata
  • Tilldela 25% av dina observationer till testmängden

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import the function for splitting dataset into train and test
from sklearn.model_selection import ____

# Use that function to create the splits both for target and for features
# Set the test sample to be 25% of your observations
target_train, target_test, features_train, features_test = ____(target,features,____=0.25,random_state=42)
Redigera och kör kod