CommencezCommencez gratuitement

Sous-échantillonnage de l'ensemble d'entraînement

Dans la vidéo, vous avez vu que pour surmonter le problème de données déséquilibrées, vous pouvez utiliser le sous- ou le suréchantillonnage. L'ensemble d'entraînement a été sous-échantillonné pour vous, de sorte que 1/3 de l'ensemble d'entraînement est composé de défauts de paiement et 2/3 de non-défauts. Le jeu de données obtenu est disponible dans votre espace de travail sous le nom undersampled_training_set, et contient moins d'observations (6570 au lieu de 19394). Dans cet exercice, vous allez créer un arbre de décision à partir de ce jeu de données sous-échantillonné.

Vous remarquerez que les arbres dans cet exercice et le suivant sont très grands, au point où vous ne pouvez plus vraiment les lire. Ne vous en faites pas pour l'instant : nous vous montrerons, dans la prochaine vidéo, comment les rendre plus faciles à gérer !

Cette activité fait partie du cours

Modélisation du risque de crédit en R

Voir le cours

Instructions de l’exercice

  • Le paquet rpart a été installé pour vous. Chargez-le dans votre espace de travail.
  • Modifiez le code fourni pour construire un arbre de décision à partir de l'ensemble d'entraînement sous-échantillonné plutôt que training_set. Ajoutez aussi l'argument control = rpart.control(cp = 0.001). cp, soit le paramètre de complexité, est la valeur seuil de la diminution de l'insuffisance d'ajustement globale pour toute division. Si cp n'est pas atteint, les divisions supplémentaires ne seront pas poursuivies. La valeur par défaut de cp est 0,01, mais pour des problèmes complexes, il est recommandé d'assouplir cp.
  • Tracez l'arbre de décision avec la fonction plot et le nom de l'objet arbre. Ajoutez un deuxième argument uniform = TRUE pour obtenir des branches de même taille.
  • La commande précédente crée simplement un arbre avec des nœuds et des arêtes, mais sans aucun texte (ou « étiquettes »). Utilisez la fonction text() avec seul argument tree_undersample pour ajouter les étiquettes.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load package rpart in your workspace.


# Change the code provided in the video such that a decision tree is constructed using the undersampled training set. Include rpart.control to relax the complexity parameter to 0.001.
tree_undersample <- rpart(loan_status ~ ., method = "class",
                          data =  training_set)

# Plot the decision tree


# Add labels to the decision tree
Modifier et exécuter le code