Kom igångKom igång gratis

Dataramar för korsvalidering

Nu när du har avsatt en del av dina data som testdata kan du använda den återstående delen för att hitta den bäst presterande modellen.

I den här övningen delar du upp träningsdata i en serie av 5 tränings- och valideringsuppsättningar med hjälp av funktionen vfold_cv() från paketet rsample.

Den här övningen är en del av kursen

Maskininlärning med Tidyverse

Visa kurs

Övningsinstruktioner

  • Bygg en dataram för 5-faldig korsvalidering från training_data med vfold_cv() och tilldela den till cv_split.
  • Förbered cv_data genom att lägga till två nya kolumner i cv_split:
    • train: innehåller träningsdataramarna genom att mappa training() över kolumnen splits.
    • validate: innehåller valideringsdataramarna genom att mappa testing() över kolumnen splits.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

set.seed(42)

# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)

cv_data <- cv_split %>% 
  mutate(
    # Extract the train data frame for each split
    train = map(___, ~___(.x)), 
    # Extract the validate data frame for each split
    validate = map(___, ~___(.x))
  )

# Use head() to preview cv_data
head(cv_data)
Redigera och kör kod