Data frames de validation croisée
Maintenant que vous avez mis de côté une partie de vos données comme testing data, vous pouvez utiliser le reste pour trouver le modèle le plus performant.
Dans cet exercice, vous allez découper les données d’entraînement en une série de 5 ensembles train/validate à l’aide de la fonction vfold_cv() du package rsample.
Cet exercice fait partie du cours
<cours>Machine Learning dans le tidyverse</cours>Instructions de l’exercice
- Construisez un data frame pour une validation croisée en 5 plis à partir de
training_dataavecvfold_cv()et affectez-le àcv_split. - Préparez
cv_dataen ajoutant deux nouvelles colonnes àcv_split:train: contenant les data frames d’entraînement en appliquanttraining()sur la colonnesplits.validate: contenant les data frames de validation en appliquanttesting()sur la colonnesplits.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
set.seed(42)
# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)
cv_data <- cv_split %>%
mutate(
# Extract the train data frame for each split
train = map(___, ~___(.x)),
# Extract the validate data frame for each split
validate = map(___, ~___(.x))
)
# Use head() to preview cv_data
head(cv_data)