Împărțirea în set de antrenament și set de testare
În acest capitol, vei continua să lucrezi cu setul de date ANSUR. Înainte de a construi un model pe datele tale, trebuie să decizi ce caracteristică vrei să prezici. În acest caz, scopul este să prezici genul.
Va trebui să extragi coloana care conține această caracteristică din setul de date, apoi să împarți datele într-un set de antrenament și un set de testare. Setul de antrenament va fi folosit pentru a antrena modelul, iar setul de testare va fi folosit pentru a-i evalua performanța pe date nevăzute.
ansur_df a fost deja încărcat pentru tine.
Acest exercițiu face parte din cursul
Reducerea dimensionalității în Python
Instrucțiuni pentru exercițiu
- Importă funcția
train_test_splitdinsklearn.model_selection. - Atribuie coloana
'Gender'variabilei y. - Elimină coloana
'Gender'din DataFrame și atribuie rezultatul variabileiX. - Setează dimensiunea setului de testare la 30%, pentru o împărțire de 70% antrenament și 30% testare.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Import train_test_split()
from ____.____ import ____
# Select the Gender column as the feature to be predicted (y)
y = ansur_df[____]
# Remove the Gender column to create the training data
X = ansur_df.____(____, ____)
# Perform a 70% train and 30% test data split
X_train, X_test, y_train, y_test = ____(X, y, ____=____)
print(f"{X_test.shape[0]} rows in test set vs. {X_train.shape[0]} in training set, {X_test.shape[1]} Features.")