ÎncepețiÎncepe gratuit

Împărțirea în set de antrenament și set de testare

În acest capitol, vei continua să lucrezi cu setul de date ANSUR. Înainte de a construi un model pe datele tale, trebuie să decizi ce caracteristică vrei să prezici. În acest caz, scopul este să prezici genul.

Va trebui să extragi coloana care conține această caracteristică din setul de date, apoi să împarți datele într-un set de antrenament și un set de testare. Setul de antrenament va fi folosit pentru a antrena modelul, iar setul de testare va fi folosit pentru a-i evalua performanța pe date nevăzute.

ansur_df a fost deja încărcat pentru tine.

Acest exercițiu face parte din cursul

Reducerea dimensionalității în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă funcția train_test_split din sklearn.model_selection.
  • Atribuie coloana 'Gender' variabilei y.
  • Elimină coloana 'Gender' din DataFrame și atribuie rezultatul variabilei X.
  • Setează dimensiunea setului de testare la 30%, pentru o împărțire de 70% antrenament și 30% testare.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import train_test_split()
from ____.____ import ____

# Select the Gender column as the feature to be predicted (y)
y = ansur_df[____]

# Remove the Gender column to create the training data
X = ansur_df.____(____, ____)

# Perform a 70% train and 30% test data split
X_train, X_test, y_train, y_test = ____(X, y, ____=____)

print(f"{X_test.shape[0]} rows in test set vs. {X_train.shape[0]} in training set, {X_test.shape[1]} Features.")
Editează și rulează codul