ÎncepețiÎncepe gratuit

Date frame-uri pentru validarea încrucișată

Acum că ai păstrat o parte din date ca date de testare, poți folosi restul pentru a găsi modelul cu cea mai bună performanță.

În acest exercițiu, vei împărți datele de antrenament într-o serie de 5 seturi de antrenament-validare folosind funcția vfold_cv() din pachetul rsample.

Acest exercițiu face parte din cursul

Machine Learning în Tidyverse

Vezi cursul

Instrucțiuni pentru exercițiu

  • Construiește un data frame pentru validare încrucișată cu 5 fold-uri din training_data folosind vfold_cv() și atribuie-l variabilei cv_split.
  • Pregătește cv_data adăugând două coloane noi la cv_split:
    • train: care să conțină data frame-urile de antrenament, mapând training() peste coloana splits.
    • validate: care să conțină data frame-urile de validare, mapând testing() peste coloana splits.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

set.seed(42)

# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)

cv_data <- cv_split %>% 
  mutate(
    # Extract the train data frame for each split
    train = map(___, ~___(.x)), 
    # Extract the validate data frame for each split
    validate = map(___, ~___(.x))
  )

# Use head() to preview cv_data
head(cv_data)
Editează și rulează codul