Tränings- och testuppdelning
I det här kapitlet fortsätter du att arbeta med ANSUR-datamängden. Innan du kan bygga en modell behöver du bestämma vilket särdrag du vill förutsäga. I det här fallet försöker du förutsäga kön.
Du behöver extrahera kolumnen med det här sädraget från datamängden och sedan dela upp data i ett tränings- och ett testset. Träningssettet används för att träna modellen, och testsettet används för att utvärdera dess prestanda på osedd data.
ansur_df har redan laddats in åt dig.
Den här övningen är en del av kursen
Dimensionsreduktion i Python
Övningsinstruktioner
- Importera funktionen
train_test_splitfrånsklearn.model_selection. - Tilldela kolumnen
'Gender'till y. - Ta bort kolumnen
'Gender'från DataFrame och tilldela resultatet tillX. - Sätt teststorleken till 30% för att utföra en 70/30-uppdelning i tränings- och testdata.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Import train_test_split()
from ____.____ import ____
# Select the Gender column as the feature to be predicted (y)
y = ansur_df[____]
# Remove the Gender column to create the training data
X = ansur_df.____(____, ____)
# Perform a 70% train and 30% test data split
X_train, X_test, y_train, y_test = ____(X, y, ____=____)
print(f"{X_test.shape[0]} rows in test set vs. {X_train.shape[0]} in training set, {X_test.shape[1]} Features.")