Zacznij terazZacznij za darmo

KDE na dużym zbiorze danych

Dostarczony kod tworzy podstawowy wykres KDE zmiennej percentage_over_limit dla wszystkich cytatów. Na pierwszy rzut oka ustawienia wyglądają sensownie: mamy dużo danych, więc szerokość przedziału jest wąska – zaledwie jeden procent. Dodano też wykres rug z obniżoną przezroczystością alpha równą 0.7.

Po uruchomieniu kodu od razu widać, że wykres nie wygląda dobrze. Estymata gęstości przypomina jeżozwierza, a wykres rug wygląda jak gruby czarny pasek z powodu ogromnego nakładania się punktów.

Popraw to, zwiększając szerokość przedziału do 2.5 oraz obniżając alpha wykresu rug do 0.05, żeby lepiej uwidocznić zagęszczenie punktów. Pamiętaj, żeby zmienić podtytuł tak, aby odzwierciedlał nową szerokość jądra!

To ćwiczenie jest częścią kursu

Najlepsze praktyki wizualizacji danych w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Zmień odchylenie standardowe jądra na 2.5
  • Ustaw alpha wykresu rug na 0.05
  • Zmień subtitle na "Gaussian kernel SD = 2.5", aby odzwierciedlał nową szerokość jądra.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

ggplot(md_speeding, aes(x = percentage_over_limit)) +
    # Increase bin width to 2.5
    geom_density(fill = 'steelblue', bw = 1,  alpha = 0.7) + 
    # lower rugplot alpha to 0.05
    geom_rug(alpha = 0.5) + 
    labs(
        title = 'Distribution of % over speed limit', 
        # modify subtitle to reflect change in kernel width
        subtitle = "Gaussian kernel SD = 1"
    )
Edytuj i uruchom kod