Rééchantillonnage des données
La première étape d'un projet de Machine Learning consiste à créer des ensembles d'entraînement et de test pour l'ajustement et l'évaluation du modèle. L'ensemble de test fournit une estimation de la performance de votre modèle sur de nouvelles données et aide à éviter le surapprentissage.
Vous travaillerez avec l'ensemble de données telecom_df, qui contient des renseignements sur les clients d'une entreprise de télécommunications. La variable à prédire est canceled_service et indique si un client a résilié son contrat avec l'entreprise. Les variables prédictives regroupent des informations sur l'utilisation du téléphone cellulaire et d'Internet des clients, ainsi que leur type de contrat et leurs frais mensuels.
Le tibble telecom_df a été chargé dans votre session.
Cette activité fait partie du cours
Modélisation avec tidymodels en R
Instructions de l’exercice
- Créez un objet
rsample,telecom_split, qui contient les instructions pour répartir aléatoirement les donnéestelecom_dfen ensembles d'entraînement et de test.- Allouez 75 % des données à l'entraînement et effectuez une stratification selon
canceled_service.
- Allouez 75 % des données à l'entraînement et effectuez une stratification selon
- Passez l'objet
telecom_splitaux fonctionsrsampleappropriées pour créer les ensembles d'entraînement et de test. - Vérifiez le nombre de lignes de chaque ensemble en les passant à la fonction
nrow().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create data split object
telecom_split <- ___(___, prop = ___,
strata = ___)
# Create the training data
telecom_training <- ___ %>%
___
# Create the test data
telecom_test <- ___ %>%
___
# Check the number of rows
nrow(___)
nrow(___)