Dataramar för korsvalidering
Nu när du har avsatt en del av dina data som testdata kan du använda den återstående delen för att hitta den bäst presterande modellen.
I den här övningen delar du upp träningsdata i en serie av 5 tränings- och valideringsuppsättningar med hjälp av funktionen vfold_cv() från paketet rsample.
Den här övningen är en del av kursen
Maskininlärning med Tidyverse
Övningsinstruktioner
- Bygg en dataram för 5-faldig korsvalidering från
training_datamedvfold_cv()och tilldela den tillcv_split. - Förbered
cv_datagenom att lägga till två nya kolumner icv_split:train: innehåller träningsdataramarna genom att mappatraining()över kolumnensplits.validate: innehåller valideringsdataramarna genom att mappatesting()över kolumnensplits.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
set.seed(42)
# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)
cv_data <- cv_split %>%
mutate(
# Extract the train data frame for each split
train = map(___, ~___(.x)),
# Extract the validate data frame for each split
validate = map(___, ~___(.x))
)
# Use head() to preview cv_data
head(cv_data)