Împărțirea datelor despre angajați
Supraadaptarea (overfitting) setului de date este o problemă frecventă în analiză. Aceasta apare atunci când un model funcționează bine pe setul de date pe care a fost antrenat, dar nu reușește să generalizeze în afara acestuia.
Împărțirea în seturi de antrenament și de testare este implementată pentru a asigura generalizarea modelului: dezvolți modelul folosind eșantionul de antrenament, apoi îl testezi pe eșantionul de testare.
În acest exercițiu, vei împărți atât target, cât și features în seturi de antrenament și de testare, în raport de 75%/25%.
Acest exercițiu face parte din cursul
HR Analytics: Predicția fluctuației angajaților în Python
Instrucțiuni pentru exercițiu
- Importă
train_test_splitdin modululsklearn.model_selection - Folosește
train_test_split()pentru a împărți setul de date în seturi de antrenament și de testare - Alocă 25% din observații setului de testare
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import the function for splitting dataset into train and test
from sklearn.model_selection import ____
# Use that function to create the splits both for target and for features
# Set the test sample to be 25% of your observations
target_train, target_test, features_train, features_test = ____(target,features,____=0.25,random_state=42)