Začněte nyníZačněte zdarma

Vytvoření trénovací a testovací sady

Rozdělení datasetu na trénovací a testovací sadu je důležitým krokem při sestavování a vyhodnocování klasifikačního modelu. Trénovací sada slouží k natrénování modelu a testovací sada k ověření jeho predikční přesnosti.

V tomto cvičení rozdělíš dataset vytvořený v předchozí kapitole na trénovací a testovací sadu. Dataset je načten v datovém rámci df a seed již byl nastaven, aby byly výsledky reprodukovatelné. Vzpomeň si, že v předchozím videu jsme pomocí několika šikovných funkcí určili horní hranici délky trénovací sady – teď je řada na tobě, abys je použil/a v praxi!

Toto cvičení je součástí kurzu

Support Vector Machines v R

Zobrazit kurz

Pokyny k cvičení

  • Urči horní hranici počtu řádků trénovací sady a ulož ji do proměnné sample_size.
  • Vytvoř vektor train, který bude obsahovat náhodně přiřazené indexy trénovací sady podle poměru 80/20.
  • Přiřaď řádky obsažené ve vektoru train do datového rámce trainset a zbývající řádky do datového rámce testset.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Set the upper bound for the length of the training set
sample_size <- ___(___ * nrow(df))

# Assign rows to training set randomly
train <- ___(seq_len(nrow(df)), size = ___)

# Yield training and test sets
trainset <- df[___, ]
testset <- df[-___, ]
Upravit a spustit kód