Valeurs aberrantes
Il est temps d’examiner la structure de la variable age. Un histogramme est affiché à droite. Comme vous l’avez vu dans la vidéo pour le revenu annuel (annual_inc), il y a beaucoup d’espace vide sur la partie droite du graphique. Cela suggère la présence possible de valeurs aberrantes. Vous allez vérifier cela à l’aide d’un nuage de points. Si vous en trouvez, vous les supprimerez.
Si des valeurs aberrantes apparaissent pour plusieurs variables, il peut être utile d’examiner des graphiques bivariés. Il est possible que ces valeurs appartiennent à la même observation. Dans ce cas, il y a d’autant plus de raisons de supprimer l’observation, car il est probable qu’une information qu’elle contient soit erronée.
Cet exercice fait partie du cours
<cours>Modélisation du risque de crédit en R</cours>Instructions de l’exercice
- Construisez un nuage de points de la variable
age(vialoan_data$age) avec la fonctionplot(). Donnez au repère vertical le libellé approprié"Age"en utilisantylabcomme deuxième argument. - La personne la plus âgée de cet ensemble dépasse 122 ans ! Récupérez l’indice de cette valeur aberrante à l’aide de which() et du seuil d’âge de 122 (vous pouvez utiliser
loan_data$age > 122). Affectez-le à l’objetindex_highage. - Créez un nouvel ensemble de données
new_dataaprès avoir supprimé l’observation à âge élevé en utilisant l’objetindex_highage. - Examinez le nuage de points bivarié, avec l’âge en abscisse et le revenu annuel en ordonnée. Modifiez les libellés en
"Age"et"Annual Income", respectivement.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Plot the age variable
# Save the outlier's index to index_highage
# Create data set new_data with outlier deleted
new_data <- loan_data[-___, ]
# Make bivariate scatterplot of age and annual income
plot(loan_data$age, loan_data$annual_inc, xlab = "___", ylab = "___")