Trames de données pour la validation croisée
Maintenant que vous avez mis de côté une partie de vos données comme testing data, vous pouvez utiliser le reste pour trouver le modèle le plus performant.
Dans cet exercice, vous allez découper les données d'entraînement en une série de 5 ensembles train-validate à l'aide de la fonction vfold_cv() du paquet rsample.
Cette activité fait partie du cours
Machine Learning dans le tidyverse
Instructions de l’exercice
- Construisez une trame de données pour une validation croisée à 5 volets à partir de
training_dataavecvfold_cv()et assignez-la àcv_split. - Préparez
cv_dataen ajoutant deux nouvelles colonnes àcv_split:train: contenant les trames de données d'entraînement en appliquanttraining()à la colonnesplits.validate: contenant les trames de données de validation en appliquanttesting()à la colonnesplits.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
set.seed(42)
# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)
cv_data <- cv_split %>%
mutate(
# Extract the train data frame for each split
train = map(___, ~___(.x)),
# Extract the validate data frame for each split
validate = map(___, ~___(.x))
)
# Use head() to preview cv_data
head(cv_data)