Date frame-uri pentru validarea încrucișată
Acum că ai păstrat o parte din date ca date de testare, poți folosi restul pentru a găsi modelul cu cea mai bună performanță.
În acest exercițiu, vei împărți datele de antrenament într-o serie de 5 seturi de antrenament-validare folosind funcția vfold_cv() din pachetul rsample.
Acest exercițiu face parte din cursul
Machine Learning în Tidyverse
Instrucțiuni pentru exercițiu
- Construiește un data frame pentru validare încrucișată cu 5 fold-uri din
training_datafolosindvfold_cv()și atribuie-l variabileicv_split. - Pregătește
cv_dataadăugând două coloane noi lacv_split:train: care să conțină data frame-urile de antrenament, mapândtraining()peste coloanasplits.validate: care să conțină data frame-urile de validare, mapândtesting()peste coloanasplits.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
set.seed(42)
# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)
cv_data <- cv_split %>%
mutate(
# Extract the train data frame for each split
train = map(___, ~___(.x)),
# Extract the validate data frame for each split
validate = map(___, ~___(.x))
)
# Use head() to preview cv_data
head(cv_data)