Vytvoření trénovací a testovací sady
Rozdělení datasetu na trénovací a testovací sadu je důležitým krokem při sestavování a vyhodnocování klasifikačního modelu. Trénovací sada slouží k natrénování modelu a testovací sada k ověření jeho predikční přesnosti.
V tomto cvičení rozdělíš dataset vytvořený v předchozí kapitole na trénovací a testovací sadu. Dataset je načten v datovém rámci df a seed již byl nastaven, aby byly výsledky reprodukovatelné. Vzpomeň si, že v předchozím videu jsme pomocí několika šikovných funkcí určili horní hranici délky trénovací sady – teď je řada na tobě, abys je použil/a v praxi!
Toto cvičení je součástí kurzu
Support Vector Machines v R
Pokyny k cvičení
- Urči horní hranici počtu řádků trénovací sady a ulož ji do proměnné
sample_size. - Vytvoř vektor
train, který bude obsahovat náhodně přiřazené indexy trénovací sady podle poměru 80/20. - Přiřaď řádky obsažené ve vektoru
traindo datového rámcetrainseta zbývající řádky do datového rámcetestset.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Set the upper bound for the length of the training set
sample_size <- ___(___ * nrow(df))
# Assign rows to training set randomly
train <- ___(seq_len(nrow(df)), size = ___)
# Yield training and test sets
trainset <- df[___, ]
testset <- df[-___, ]