Zacznij terazZacznij za darmo

Podział na zbiór treningowy i testowy

W tym rozdziale będziesz nadal pracować ze zbiorem danych ANSUR. Zanim zbudujesz model na swoich danych, musisz najpierw zdecydować, którą cechę chcesz przewidywać. W tym przypadku celem jest przewidywanie płci.

Należy wyodrębnić kolumnę zawierającą tę cechę ze zbioru danych, a następnie podzielić dane na zbiór treningowy i testowy. Zbiór treningowy posłuży do nauczenia modelu, a zbiór testowy – do sprawdzenia jego działania na nowych danych.

ansur_df zostało wcześniej wczytane.

To ćwiczenie jest częścią kursu

Redukcja wymiarowości w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zaimportuj funkcję train_test_split z modułu sklearn.model_selection.
  • Przypisz kolumnę 'Gender' do zmiennej y.
  • Usuń kolumnę 'Gender' z ramki danych i przypisz wynik do zmiennej X.
  • Ustaw rozmiar zbioru testowego na 30%, aby uzyskać podział 70% treningowych i 30% testowych.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Import train_test_split()
from ____.____ import ____

# Select the Gender column as the feature to be predicted (y)
y = ansur_df[____]

# Remove the Gender column to create the training data
X = ansur_df.____(____, ____)

# Perform a 70% train and 30% test data split
X_train, X_test, y_train, y_test = ____(X, y, ____=____)

print(f"{X_test.shape[0]} rows in test set vs. {X_train.shape[0]} in training set, {X_test.shape[1]} Features.")
Edytuj i uruchom kod