Kom igångKom igång gratis

Tränings- och testuppdelning

I det här kapitlet fortsätter du att arbeta med ANSUR-datamängden. Innan du kan bygga en modell behöver du bestämma vilket särdrag du vill förutsäga. I det här fallet försöker du förutsäga kön.

Du behöver extrahera kolumnen med det här sädraget från datamängden och sedan dela upp data i ett tränings- och ett testset. Träningssettet används för att träna modellen, och testsettet används för att utvärdera dess prestanda på osedd data.

ansur_df har redan laddats in åt dig.

Den här övningen är en del av kursen

Dimensionsreduktion i Python

Visa kurs

Övningsinstruktioner

  • Importera funktionen train_test_split från sklearn.model_selection.
  • Tilldela kolumnen 'Gender' till y.
  • Ta bort kolumnen 'Gender' från DataFrame och tilldela resultatet till X.
  • Sätt teststorleken till 30% för att utföra en 70/30-uppdelning i tränings- och testdata.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import train_test_split()
from ____.____ import ____

# Select the Gender column as the feature to be predicted (y)
y = ansur_df[____]

# Remove the Gender column to create the training data
X = ansur_df.____(____, ____)

# Perform a 70% train and 30% test data split
X_train, X_test, y_train, y_test = ____(X, y, ____=____)

print(f"{X_test.shape[0]} rows in test set vs. {X_train.shape[0]} in training set, {X_test.shape[1]} Features.")
Redigera och kör kod