Rozdělení na trénovací a testovací sadu
V této kapitole budeš dál pracovat s datasetem ANSUR. Než začneš stavět model, musíš se nejprve rozhodnout, kterou vlastnost chceš předpovídat. V tomto případě půjde o pohlaví.
Z datasetu je potřeba extrahovat sloupec s touto proměnnou a pak data rozdělit na trénovací a testovací sadu. Trénovací sada poslouží k natrénování modelu a testovací sada k ověření jeho výkonu na dosud neviděných datech.
ansur_df je pro tebe předem načtený.
Toto cvičení je součástí kurzu
Redukce dimenzionality v Pythonu
Pokyny k cvičení
- Importuj funkci
train_test_splitzsklearn.model_selection. - Přiřaď sloupec
'Gender'do proměnné y. - Odstraň sloupec
'Gender'z DataFrame a výsledek ulož doX. - Nastav velikost testovací sady na 30 %, čímž rozdělíš data v poměru 70 % trénovací a 30 % testovací.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Import train_test_split()
from ____.____ import ____
# Select the Gender column as the feature to be predicted (y)
y = ansur_df[____]
# Remove the Gender column to create the training data
X = ansur_df.____(____, ____)
# Perform a 70% train and 30% test data split
X_train, X_test, y_train, y_test = ____(X, y, ____=____)
print(f"{X_test.shape[0]} rows in test set vs. {X_train.shape[0]} in training set, {X_test.shape[1]} Features.")