Rozdělení dat o zaměstnancích
Přetrénování modelu (overfitting) je v analytice častý problém. Nastává tehdy, když model funguje dobře na datech, na kterých byl natrénován, ale nedokáže se zobecnit na nová, dosud neviděná data.
Aby bylo zajištěno správné zobecnění modelu, provádí se rozdělení dat na trénovací a testovací sadu: model natrénuješ na trénovací sadě a jeho výkon pak ověříš na sadě testovací.
V tomto cvičení rozdělíš target i features na trénovací a testovací sadu v poměru 75 %/25 %.
Toto cvičení je součástí kurzu
HR Analytics: Predicting Employee Churn in Python
Pokyny k cvičení
- Importuj
train_test_splitz modulusklearn.model_selection - Pomocí
train_test_split()rozděl dataset na trénovací a testovací sadu - Přiřaď 25 % pozorování do testovací sady
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import the function for splitting dataset into train and test
from sklearn.model_selection import ____
# Use that function to create the splits both for target and for features
# Set the test sample to be 25% of your observations
target_train, target_test, features_train, features_test = ____(target,features,____=0.25,random_state=42)