Datové rámce pro křížovou validaci
Teď, když jsi část dat vyhradil/a jako testovací data, můžeš zbývající část využít k nalezení nejlépe fungujícího modelu.
V tomto cvičení rozdělíš trénovací data do série 5 trénovacích a validačních sad pomocí funkce vfold_cv() z balíčku rsample.
Toto cvičení je součástí kurzu
Machine Learning in the Tidyverse
Pokyny k cvičení
- Ze
training_datavytvoř datový rámec pro 5-násobnou křížovou validaci pomocívfold_cv()a výsledek ulož docv_split. - Připrav
cv_datatak, že docv_splitpřidáš dva nové sloupce:train: obsahující trénovací datové rámce získané mapováním funkcetraining()přes sloupecsplits.validate: obsahující validační datové rámce získané mapováním funkcetesting()přes sloupecsplits.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
set.seed(42)
# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)
cv_data <- cv_split %>%
mutate(
# Extract the train data frame for each split
train = map(___, ~___(.x)),
# Extract the validate data frame for each split
validate = map(___, ~___(.x))
)
# Use head() to preview cv_data
head(cv_data)