Začněte nyníZačněte zdarma

Rozdělení na trénovací a testovací sadu

V této kapitole budeš dál pracovat s datasetem ANSUR. Než začneš stavět model, musíš se nejprve rozhodnout, kterou vlastnost chceš předpovídat. V tomto případě půjde o pohlaví.

Z datasetu je potřeba extrahovat sloupec s touto proměnnou a pak data rozdělit na trénovací a testovací sadu. Trénovací sada poslouží k natrénování modelu a testovací sada k ověření jeho výkonu na dosud neviděných datech.

ansur_df je pro tebe předem načtený.

Toto cvičení je součástí kurzu

Redukce dimenzionality v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Importuj funkci train_test_split z sklearn.model_selection.
  • Přiřaď sloupec 'Gender' do proměnné y.
  • Odstraň sloupec 'Gender' z DataFrame a výsledek ulož do X.
  • Nastav velikost testovací sady na 30 %, čímž rozdělíš data v poměru 70 % trénovací a 30 % testovací.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import train_test_split()
from ____.____ import ____

# Select the Gender column as the feature to be predicted (y)
y = ansur_df[____]

# Remove the Gender column to create the training data
X = ansur_df.____(____, ____)

# Perform a 70% train and 30% test data split
X_train, X_test, y_train, y_test = ____(X, y, ____=____)

print(f"{X_test.shape[0]} rows in test set vs. {X_train.shape[0]} in training set, {X_test.shape[1]} Features.")
Upravit a spustit kód