La séparation test–entraînement
Dans un workflow de Machine Learning rigoureux, il est essentiel de mettre de côté une partie de vos données (données de test) et de ne pas l’utiliser pour prendre des décisions. Cela vous permet d’évaluer de façon indépendante les performances de votre modèle une fois finalisé. Le reste des données, les données d’entraînement, sert à construire et sélectionner le meilleur modèle.
Dans cet exercice, vous allez utiliser le package rsample pour scinder vos données et effectuer la première séparation entraînement–test à partir des données gapminder.
Remarque : Comme cette séparation est aléatoire, il est recommandé de fixer une graine avant de la réaliser.
Cet exercice fait partie du cours
<cours>Machine Learning dans le tidyverse</cours>Instructions de l’exercice
- Séparez vos données en 75 % entraînement et 25 % test avec la fonction
initial_split()et affectez le résultat àgap_split. - Extrayez la table d’entraînement de
gap_splitavec la fonctiontraining(). - Extrayez la table de test de
gap_splitavec la fonctiontesting(). - Vérifiez que les dimensions de vos nouvelles tables sont bien celles attendues en utilisant la fonction
dim()surtraining_dataettesting_data.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
set.seed(42)
# Prepare the initial split object
gap_split <- initial_split(___, prop = ___)
# Extract the training data frame
training_data <- ___
# Extract the testing data frame
testing_data <- ___
# Calculate the dimensions of both training_data and testing_data
dim(___)
dim(___)