CommencerCommencez gratuitement

La séparation test–entraînement

Dans un workflow de Machine Learning rigoureux, il est essentiel de mettre de côté une partie de vos données (données de test) et de ne pas l’utiliser pour prendre des décisions. Cela vous permet d’évaluer de façon indépendante les performances de votre modèle une fois finalisé. Le reste des données, les données d’entraînement, sert à construire et sélectionner le meilleur modèle.

Dans cet exercice, vous allez utiliser le package rsample pour scinder vos données et effectuer la première séparation entraînement–test à partir des données gapminder.

Remarque : Comme cette séparation est aléatoire, il est recommandé de fixer une graine avant de la réaliser.

Cet exercice fait partie du cours

<cours>Machine Learning dans le tidyverse</cours>
Voir le cours

Instructions de l’exercice

  • Séparez vos données en 75 % entraînement et 25 % test avec la fonction initial_split() et affectez le résultat à gap_split.
  • Extrayez la table d’entraînement de gap_split avec la fonction training().
  • Extrayez la table de test de gap_split avec la fonction testing().
  • Vérifiez que les dimensions de vos nouvelles tables sont bien celles attendues en utilisant la fonction dim() sur training_data et testing_data.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

set.seed(42)

# Prepare the initial split object
gap_split <- initial_split(___, prop = ___)

# Extract the training data frame
training_data <- ___

# Extract the testing data frame
testing_data <- ___

# Calculate the dimensions of both training_data and testing_data
dim(___)
dim(___)
Modifier et exécuter le code