Passer de l'histogramme au DCK
Pour ces exercices, nous allons examiner un sous-ensemble de nos données sur les constats remis à des "Heavy Duty Truck". Supposons que nous soyons un camionneur à l'aise avec les données et que nous voulions savoir à quel moment il est le plus dangereux d'être sur la route. Notez que la taille de l'échantillon n'est ici que de 32 observations.
Ci-dessous, vous trouverez du code pour créer un histogramme par défaut avec ggplot. Sans surprise, ce n'est pas idéal. Il n'y a pas assez de données pour remplir même 30 compartiments, ce qui rend le graphique difficile à lire et à interpréter. Remplacez la géométrie par une courbe de densité à noyau en utilisant geom_density(). Enfin, pour assurer la plus grande transparence dans votre visualisation, ajoutez un sous-titre au graphique indiquant au lecteur la largeur de bande utilisée pour votre DCK.
Cette activité fait partie du cours
Les meilleures pratiques de visualisation avec R
Instructions de l’exercice
- Remplacez la géométrie d'histogramme par une densité (
geom_density()). - Modifiez la largeur de bande par défaut pour qu'elle soit de
1.5unités. - Ajoutez le
subtitle"Gaussian kernel SD = 1.5"à votre graphique pour indiquer au lecteur la largeur de bande de votre noyau.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# filter data to just heavy duty trucks
truck_speeding <- md_speeding %>%
filter(vehicle_type == "Heavy Duty Truck")
ggplot(truck_speeding, aes(x = hour_of_day)) +
# switch to density with bin width of 1.5, keep fill
geom_histogram(fill = 'steelblue') +
# add a subtitle stating binwidth
labs(title = 'Citations by hour')