Z histogramu na KDE
V těchto cvičeních se zaměříme na podmnožinu dat o pokutách udělených vozidlům kategorie "Heavy Duty Truck". Představ si, že jsi zkušený řidič kamionu a chceš vědět, kdy je provoz na silnici nejrizikovější. Velikost vzorku je zde pouze 32 pozorování.
Níže najdeš kód, který vytváří výchozí histogram v ggplotu. Nepřekvapivě není příliš přehledný – dat není dost ani na to, aby zaplnila 30 sloupců, takže je obtížné z grafu cokoliv vyčíst. Změň typ geometrie na KDE pomocí geom_density(). A aby byla vizualizace co nejtransparentnější, přidej do grafu podtitulek s informací o šířce pásma použitého pro KDE.
Toto cvičení je součástí kurzu
Vizualizace dat v R – nejlepší postupy
Pokyny k cvičení
- Změň geometrii histogramu na hustotní (
geom_density()). - Uprav výchozí šířku pásma na
1.5jednotky. - Přidej do grafu
subtitle"Gaussian kernel SD = 1.5", aby čtenář věděl, jaká šířka pásma jádra byla použita.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# filter data to just heavy duty trucks
truck_speeding <- md_speeding %>%
filter(vehicle_type == "Heavy Duty Truck")
ggplot(truck_speeding, aes(x = hour_of_day)) +
# switch to density with bin width of 1.5, keep fill
geom_histogram(fill = 'steelblue') +
# add a subtitle stating binwidth
labs(title = 'Citations by hour')