CommencezCommencez gratuitement

Rééchantillonnage des données

La première étape d'un projet de Machine Learning consiste à créer des ensembles d'entraînement et de test pour l'ajustement et l'évaluation du modèle. L'ensemble de test fournit une estimation de la performance de votre modèle sur de nouvelles données et aide à éviter le surapprentissage.

Vous travaillerez avec l'ensemble de données telecom_df, qui contient des renseignements sur les clients d'une entreprise de télécommunications. La variable à prédire est canceled_service et indique si un client a résilié son contrat avec l'entreprise. Les variables prédictives regroupent des informations sur l'utilisation du téléphone cellulaire et d'Internet des clients, ainsi que leur type de contrat et leurs frais mensuels.

Le tibble telecom_df a été chargé dans votre session.

Cette activité fait partie du cours

Modélisation avec tidymodels en R

Voir le cours

Instructions de l’exercice

  • Créez un objet rsample, telecom_split, qui contient les instructions pour répartir aléatoirement les données telecom_df en ensembles d'entraînement et de test.
    • Allouez 75 % des données à l'entraînement et effectuez une stratification selon canceled_service.
  • Passez l'objet telecom_split aux fonctions rsample appropriées pour créer les ensembles d'entraînement et de test.
  • Vérifiez le nombre de lignes de chaque ensemble en les passant à la fonction nrow().

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create data split object
telecom_split <- ___(___, prop = ___,
                     strata = ___)

# Create the training data
telecom_training <- ___ %>% 
  ___

# Create the test data
telecom_test <- ___ %>% 
  ___

# Check the number of rows
nrow(___)
nrow(___)
Modifier et exécuter le code