Valeurs aberrantes
Il est maintenant temps d'examiner la structure de la variable age. Un histogramme est affiché à droite. Comme vous l'avez vu dans la vidéo pour le revenu annuel (annual_inc), le côté droit du graphique présente beaucoup d'espace vide. Cela peut indiquer la présence de valeurs aberrantes. Vous allez vérifier cela à l'aide d'un nuage de points. Si vous en trouvez, vous les supprimerez.
Si plusieurs variables présentent des valeurs aberrantes, il peut être utile d'observer des graphiques bivariés. Il est possible que ces valeurs appartiennent à la même observation. Dans ce cas, c'est une raison supplémentaire de supprimer l'observation, car il est plus probable que certaines informations qu'elle contient soient erronées.
Cette activité fait partie du cours
Modélisation du risque de crédit en R
Instructions de l’exercice
- Créez un nuage de points de la variable
age(vialoan_data$age) avec la fonctionplot(). Donnez à l'axe des ordonnées l'étiquette appropriée"Age"à l'aide deylabcomme deuxième argument. - La personne la plus âgée de cet ensemble de données a plus de 122 ans ! Obtenez l'indice de cette valeur aberrante à l'aide de which() et en utilisant 122 ans comme seuil (vous pouvez le faire avec
loan_data$age > 122). Assignez cet indice à l'objetindex_highage. - Créez un nouvel ensemble de données
new_dataaprès avoir retiré l'observation avec l'âge élevé à l'aide de l'objetindex_highage. - Examinez le nuage de points bivarié, avec l'âge sur l'axe des abscisses et le revenu annuel sur l'axe des ordonnées. Modifiez les étiquettes pour
"Age"et"Annual Income", respectivement.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Plot the age variable
# Save the outlier's index to index_highage
# Create data set new_data with outlier deleted
new_data <- loan_data[-___, ]
# Make bivariate scatterplot of age and annual income
plot(loan_data$age, loan_data$annual_inc, xlab = "___", ylab = "___")