KDE na dużym zbiorze danych
Dostarczony kod tworzy podstawowy wykres KDE zmiennej percentage_over_limit dla wszystkich cytatów. Na pierwszy rzut oka ustawienia wyglądają sensownie: mamy dużo danych, więc szerokość przedziału jest wąska – zaledwie jeden procent. Dodano też wykres rug z obniżoną przezroczystością alpha równą 0.7.
Po uruchomieniu kodu od razu widać, że wykres nie wygląda dobrze. Estymata gęstości przypomina jeżozwierza, a wykres rug wygląda jak gruby czarny pasek z powodu ogromnego nakładania się punktów.
Popraw to, zwiększając szerokość przedziału do 2.5 oraz obniżając alpha wykresu rug do 0.05, żeby lepiej uwidocznić zagęszczenie punktów. Pamiętaj, żeby zmienić podtytuł tak, aby odzwierciedlał nową szerokość jądra!
To ćwiczenie jest częścią kursu
Najlepsze praktyki wizualizacji danych w R
Instrukcje do ćwiczenia
- Zmień odchylenie standardowe jądra na
2.5 - Ustaw
alphawykresu rug na0.05 - Zmień
subtitlena"Gaussian kernel SD = 2.5", aby odzwierciedlał nową szerokość jądra.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
ggplot(md_speeding, aes(x = percentage_over_limit)) +
# Increase bin width to 2.5
geom_density(fill = 'steelblue', bw = 1, alpha = 0.7) +
# lower rugplot alpha to 0.05
geom_rug(alpha = 0.5) +
labs(
title = 'Distribution of % over speed limit',
# modify subtitle to reflect change in kernel width
subtitle = "Gaussian kernel SD = 1"
)