Histogrammes
Le jeu de données loan_data est chargé dans votre espace de travail. Vous avez précédemment exploré des variables catégorielles avec la fonction CrossTable(). Vous souhaitez maintenant examiner des variables continues pour repérer d’éventuelles valeurs aberrantes ou des structures de données inattendues.
Pour cela, testons la fonction hist() afin de comprendre la distribution du nombre de prêts pour différents clients.
Cet exercice fait partie du cours
<cours>Modélisation du risque de crédit en R</cours>Instructions de l’exercice
- Utilisez hist() pour créer un histogramme avec un seul argument :
loan_data$loan_amnt. Affectez le résultat à un nouvel objet appeléhist_1. - Utilisez
$breaksavec l’objethist_1pour obtenir plus d’informations sur les bornes (breaks) de l’histogramme. Connaître l’emplacement des bornes est important : si elles sont mal choisies, l’histogramme peut induire en erreur. - Modifiez le nombre de bornes dans
hist_1à 200 en précisant l’argumentbreaks. Donnez également le nom"Loan amount"à l’axe des x avec l’argumentxlabet le titre"Histogram of the loan amount"avec l’argumentmain. Enregistrez le résultat danshist_2. Pourquoi les pics apparaissent-ils à ces endroits ?
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create histogram of loan_amnt: hist_1
# Print locations of the breaks in hist_1
# Change number of breaks and add labels: hist_2
hist_2 <- hist(loan_data$loan_amnt, breaks = ___, xlab = "___",
main = "___")