CommencezCommencez gratuitement

Passer de l'histogramme au DCK

Pour ces exercices, nous allons examiner un sous-ensemble de nos données sur les constats remis à des "Heavy Duty Truck". Supposons que nous soyons un camionneur à l'aise avec les données et que nous voulions savoir à quel moment il est le plus dangereux d'être sur la route. Notez que la taille de l'échantillon n'est ici que de 32 observations.

Ci-dessous, vous trouverez du code pour créer un histogramme par défaut avec ggplot. Sans surprise, ce n'est pas idéal. Il n'y a pas assez de données pour remplir même 30 compartiments, ce qui rend le graphique difficile à lire et à interpréter. Remplacez la géométrie par une courbe de densité à noyau en utilisant geom_density(). Enfin, pour assurer la plus grande transparence dans votre visualisation, ajoutez un sous-titre au graphique indiquant au lecteur la largeur de bande utilisée pour votre DCK.

Cette activité fait partie du cours

Les meilleures pratiques de visualisation avec R

Voir le cours

Instructions de l’exercice

  • Remplacez la géométrie d'histogramme par une densité (geom_density()).
  • Modifiez la largeur de bande par défaut pour qu'elle soit de 1.5 unités.
  • Ajoutez le subtitle "Gaussian kernel SD = 1.5" à votre graphique pour indiquer au lecteur la largeur de bande de votre noyau.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# filter data to just heavy duty trucks
truck_speeding <- md_speeding %>% 
    filter(vehicle_type == "Heavy Duty Truck")
 
ggplot(truck_speeding, aes(x = hour_of_day)) +
    # switch to density with bin width of 1.5, keep fill 
    geom_histogram(fill = 'steelblue') +
    # add a subtitle stating binwidth
    labs(title = 'Citations by hour')
Modifier et exécuter le code