Začněte nyníZačněte zdarma

Datové rámce pro křížovou validaci

Teď, když jsi část dat vyhradil/a jako testovací data, můžeš zbývající část využít k nalezení nejlépe fungujícího modelu.

V tomto cvičení rozdělíš trénovací data do série 5 trénovacích a validačních sad pomocí funkce vfold_cv() z balíčku rsample.

Toto cvičení je součástí kurzu

Machine Learning in the Tidyverse

Zobrazit kurz

Pokyny k cvičení

  • Ze training_data vytvoř datový rámec pro 5-násobnou křížovou validaci pomocí vfold_cv() a výsledek ulož do cv_split.
  • Připrav cv_data tak, že do cv_split přidáš dva nové sloupce:
    • train: obsahující trénovací datové rámce získané mapováním funkce training() přes sloupec splits.
    • validate: obsahující validační datové rámce získané mapováním funkce testing() přes sloupec splits.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

set.seed(42)

# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)

cv_data <- cv_split %>% 
  mutate(
    # Extract the train data frame for each split
    train = map(___, ~___(.x)), 
    # Extract the validate data frame for each split
    validate = map(___, ~___(.x))
  )

# Use head() to preview cv_data
head(cv_data)
Upravit a spustit kód