Začněte nyníZačněte zdarma

Rozdělení dat o zaměstnancích

Přetrénování modelu (overfitting) je v analytice častý problém. Nastává tehdy, když model funguje dobře na datech, na kterých byl natrénován, ale nedokáže se zobecnit na nová, dosud neviděná data.

Aby bylo zajištěno správné zobecnění modelu, provádí se rozdělení dat na trénovací a testovací sadu: model natrénuješ na trénovací sadě a jeho výkon pak ověříš na sadě testovací.

V tomto cvičení rozdělíš target i features na trénovací a testovací sadu v poměru 75 %/25 %.

Toto cvičení je součástí kurzu

HR Analytics: Predicting Employee Churn in Python

Zobrazit kurz

Pokyny k cvičení

  • Importuj train_test_split z modulu sklearn.model_selection
  • Pomocí train_test_split() rozděl dataset na trénovací a testovací sadu
  • Přiřaď 25 % pozorování do testovací sady

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import the function for splitting dataset into train and test
from sklearn.model_selection import ____

# Use that function to create the splits both for target and for features
# Set the test sample to be 25% of your observations
target_train, target_test, features_train, features_test = ____(target,features,____=0.25,random_state=42)
Upravit a spustit kód