La division train-test
Dans un flux de travail de Machine Learning rigoureux, il est essentiel de mettre de côté une partie de vos données (données de test) et de ne pas l'utiliser lors de la prise de décisions. Cela vous permet d'évaluer de façon indépendante la performance de votre modèle une fois finalisé. Le reste des données, les données d'entraînement, sert à construire le modèle et à choisir le meilleur.
Dans cet exercice, vous allez utiliser le paquet rsample pour diviser vos données et effectuer la première séparation train-test de vos données gapminder.
Remarque : Comme il s'agit d'une séparation aléatoire, il est recommandé de fixer une graine (seed) avant de procéder au découpage.
Cette activité fait partie du cours
Machine Learning dans le tidyverse
Instructions de l’exercice
- Divisez vos données en 75 % pour l'entraînement et 25 % pour le test à l'aide de la fonction
initial_split()et assignez le résultat àgap_split. - Extrayez la trame de données d'entraînement de
gap_splitavec la fonctiontraining(). - Extrayez la trame de données de test de
gap_splitavec la fonctiontesting(). - Vérifiez que les dimensions de vos nouvelles trames de données correspondent à vos attentes en utilisant la fonction
dim()surtraining_dataettesting_data.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
set.seed(42)
# Prepare the initial split object
gap_split <- initial_split(___, prop = ___)
# Extract the training data frame
training_data <- ___
# Extract the testing data frame
testing_data <- ___
# Calculate the dimensions of both training_data and testing_data
dim(___)
dim(___)