Împărțirea datelor în seturi de antrenament și testare
Ești acum pregătit să construiești un model de învățare automată complet, urmând câțiva pași simpli! Vei explora detaliile modelării mult mai aprofundat în capitolele următoare, dar pentru moment vei exersa și înțelege etapele esențiale.
Caracteristicile independente au fost încărcate pentru tine ca un DataFrame pandas numit X, iar valorile dependente ca o Series pandas numită Y.
De asemenea, funcția train_test_split a fost importată din biblioteca sklearn. Acum vei crea seturi de antrenament și testare, apoi vei verifica că datele au fost împărțite corect.
Acest exercițiu face parte din cursul
Machine Learning pentru Marketing în Python
Instrucțiuni pentru exercițiu
- Împarte
XșiYîn seturi de antrenament și testare, alocând 25% din date pentru testare. - Asigură-te că setul de antrenament conține doar 75% din datele originale.
- Asigură-te că setul de testare conține doar 25% din datele originale.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Split X and Y into training and testing datasets
train_X, test_X, train_Y, test_Y = ___(___, ___, test_size=0.___)
# Ensure training dataset has only 75% of original X data
print(___.shape[0] / X.shape[0])
# Ensure testing dataset has only 25% of original X data
print(___.shape[0] / ___.shape[0])