CommencerCommencez gratuitement

Valeurs aberrantes

Il est temps d’examiner la structure de la variable age. Un histogramme est affiché à droite. Comme vous l’avez vu dans la vidéo pour le revenu annuel (annual_inc), il y a beaucoup d’espace vide sur la partie droite du graphique. Cela suggère la présence possible de valeurs aberrantes. Vous allez vérifier cela à l’aide d’un nuage de points. Si vous en trouvez, vous les supprimerez.

Si des valeurs aberrantes apparaissent pour plusieurs variables, il peut être utile d’examiner des graphiques bivariés. Il est possible que ces valeurs appartiennent à la même observation. Dans ce cas, il y a d’autant plus de raisons de supprimer l’observation, car il est probable qu’une information qu’elle contient soit erronée.

Cet exercice fait partie du cours

<cours>Modélisation du risque de crédit en R</cours>
Voir le cours

Instructions de l’exercice

  • Construisez un nuage de points de la variable age (via loan_data$age) avec la fonction plot(). Donnez au repère vertical le libellé approprié "Age" en utilisant ylab comme deuxième argument.
  • La personne la plus âgée de cet ensemble dépasse 122 ans ! Récupérez l’indice de cette valeur aberrante à l’aide de which() et du seuil d’âge de 122 (vous pouvez utiliser loan_data$age > 122). Affectez-le à l’objet index_highage.
  • Créez un nouvel ensemble de données new_data après avoir supprimé l’observation à âge élevé en utilisant l’objet index_highage.
  • Examinez le nuage de points bivarié, avec l’âge en abscisse et le revenu annuel en ordonnée. Modifiez les libellés en "Age" et "Annual Income", respectivement.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Plot the age variable


# Save the outlier's index to index_highage


# Create data set new_data with outlier deleted
new_data <- loan_data[-___, ]

# Make bivariate scatterplot of age and annual income
plot(loan_data$age, loan_data$annual_inc, xlab = "___", ylab = "___")
Modifier et exécuter le code