ÎncepețiÎncepe gratuit

Împărțirea datelor despre angajați

Supraadaptarea (overfitting) setului de date este o problemă frecventă în analiză. Aceasta apare atunci când un model funcționează bine pe setul de date pe care a fost antrenat, dar nu reușește să generalizeze în afara acestuia.

Împărțirea în seturi de antrenament și de testare este implementată pentru a asigura generalizarea modelului: dezvolți modelul folosind eșantionul de antrenament, apoi îl testezi pe eșantionul de testare.

În acest exercițiu, vei împărți atât target, cât și features în seturi de antrenament și de testare, în raport de 75%/25%.

Acest exercițiu face parte din cursul

HR Analytics: Predicția fluctuației angajaților în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă train_test_split din modulul sklearn.model_selection
  • Folosește train_test_split() pentru a împărți setul de date în seturi de antrenament și de testare
  • Alocă 25% din observații setului de testare

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import the function for splitting dataset into train and test
from sklearn.model_selection import ____

# Use that function to create the splits both for target and for features
# Set the test sample to be 25% of your observations
target_train, target_test, features_train, features_test = ____(target,features,____=0.25,random_state=42)
Editează și rulează codul