Podział na zbiór treningowy i testowy
W tym rozdziale będziesz nadal pracować ze zbiorem danych ANSUR. Zanim zbudujesz model na swoich danych, musisz najpierw zdecydować, którą cechę chcesz przewidywać. W tym przypadku celem jest przewidywanie płci.
Należy wyodrębnić kolumnę zawierającą tę cechę ze zbioru danych, a następnie podzielić dane na zbiór treningowy i testowy. Zbiór treningowy posłuży do nauczenia modelu, a zbiór testowy – do sprawdzenia jego działania na nowych danych.
ansur_df zostało wcześniej wczytane.
To ćwiczenie jest częścią kursu
Redukcja wymiarowości w Pythonie
Instrukcje do ćwiczenia
- Zaimportuj funkcję
train_test_splitz modułusklearn.model_selection. - Przypisz kolumnę
'Gender'do zmiennej y. - Usuń kolumnę
'Gender'z ramki danych i przypisz wynik do zmiennejX. - Ustaw rozmiar zbioru testowego na 30%, aby uzyskać podział 70% treningowych i 30% testowych.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Import train_test_split()
from ____.____ import ____
# Select the Gender column as the feature to be predicted (y)
y = ansur_df[____]
# Remove the Gender column to create the training data
X = ansur_df.____(____, ____)
# Perform a 70% train and 30% test data split
X_train, X_test, y_train, y_test = ____(X, y, ____=____)
print(f"{X_test.shape[0]} rows in test set vs. {X_train.shape[0]} in training set, {X_test.shape[1]} Features.")