Od histogramu do KDE
W tych ćwiczeniach przyjrzymy się podzbiorowi danych dotyczących mandatów wystawionych pojazdom "Heavy Duty Truck". Wyobraź sobie, że jesteś kierowcą ciężarówki i chcesz wiedzieć, o której porze dnia ryzyko na drodze jest największe. Pamiętaj, że próba liczy tylko 32 obserwacje.
Poniżej znajdziesz kod tworzący domyślny histogram w ggplot. Jak można się spodziewać, nie wygląda najlepiej – dane są zbyt skąpe, żeby wypełnić nawet 30 przedziałów, co sprawia, że wykres jest trudny do odczytania. Zmień typ geometrii na KDE, używając geom_density(). Następnie, aby zachować pełną przejrzystość wizualizacji, dodaj do wykresu podtytuł informujący odbiorcę o szerokości przedziału użytej w KDE.
To ćwiczenie jest częścią kursu
Najlepsze praktyki wizualizacji danych w R
Instrukcje do ćwiczenia
- Zmień geometrię histogramu na wykres gęstości (
geom_density()). - Ustaw domyślną szerokość przedziału na
1.5jednostki. - Dodaj do wykresu
subtitleo treści"Gaussian kernel SD = 1.5", informujący odbiorcę o szerokości przedziału jądra.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# filter data to just heavy duty trucks
truck_speeding <- md_speeding %>%
filter(vehicle_type == "Heavy Duty Truck")
ggplot(truck_speeding, aes(x = hour_of_day)) +
# switch to density with bin width of 1.5, keep fill
geom_histogram(fill = 'steelblue') +
# add a subtitle stating binwidth
labs(title = 'Citations by hour')