CommencezCommencez gratuitement

Trames de données pour la validation croisée

Maintenant que vous avez mis de côté une partie de vos données comme testing data, vous pouvez utiliser le reste pour trouver le modèle le plus performant.

Dans cet exercice, vous allez découper les données d'entraînement en une série de 5 ensembles train-validate à l'aide de la fonction vfold_cv() du paquet rsample.

Cette activité fait partie du cours

Machine Learning dans le tidyverse

Voir le cours

Instructions de l’exercice

  • Construisez une trame de données pour une validation croisée à 5 volets à partir de training_data avec vfold_cv() et assignez-la à cv_split.
  • Préparez cv_data en ajoutant deux nouvelles colonnes à cv_split :
    • train : contenant les trames de données d'entraînement en appliquant training() à la colonne splits.
    • validate : contenant les trames de données de validation en appliquant testing() à la colonne splits.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

set.seed(42)

# Prepare the data frame containing the cross validation partitions
cv_split <- vfold_cv(___, v = ___)

cv_data <- cv_split %>% 
  mutate(
    # Extract the train data frame for each split
    train = map(___, ~___(.x)), 
    # Extract the validate data frame for each split
    validate = map(___, ~___(.x))
  )

# Use head() to preview cv_data
head(cv_data)
Modifier et exécuter le code