CommencerCommencez gratuitement

Data frames de validation croisée

Maintenant que vous avez mis de côté une partie de vos données comme testing data, vous pouvez utiliser le reste pour trouver le modèle le plus performant.

Dans cet exercice, vous allez découper les données d’entraînement en une série de 5 ensembles train/validate à l’aide de la fonction vfold_cv() du package rsample.

Cet exercice fait partie du cours

<cours>Machine Learning dans le tidyverse</cours>
Voir le cours

Instructions de l’exercice

  • Construisez un data frame pour une validation croisée en 5 plis à partir de training_data avec vfold_cv() et affectez-le à cv_split.
  • Préparez cv_data en ajoutant deux nouvelles colonnes à cv_split :
    • train : contenant les data frames d’entraînement en appliquant training() sur la colonne splits.
    • validate : contenant les data frames de validation en appliquant testing() sur la colonne splits.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

set.seed(42)

# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)

cv_data <- cv_split %>% 
  mutate(
    # Extract the train data frame for each split
    train = map(___, ~___(.x)), 
    # Extract the validate data frame for each split
    validate = map(___, ~___(.x))
  )

# Use head() to preview cv_data
head(cv_data)
Modifier et exécuter le code