KDE med stora datamängder
Koden som tillhandahålls skapar en grundläggande KDE av percentage_over_limit för alla citeringar. Vid första anblick verkar inställningarna rimliga. Vi har mycket data, så vi sätter bin width snävt: bara en procent. Dessutom har ett rugplot lagts till med ett sänkt alfa-värde på 0.7.
När du kör koden märker du genast att resultatet inte är ett bra diagram. Täthetsskattningen liknar en igelkott och rugploten är i princip ett tjockt svart streck på grund av kraftig överlappning.
Åtgärda detta genom att öka bin width till 2.5 och sänka alpha för rugploten till 0.05 för att försöka ge en uppfattning om punktöverlappningen. Glöm inte att uppdatera undertiteln så att den återspeglar den nya kärnbredden!
Den här övningen är en del av kursen
Visualiseringsmetoder i R
Övningsinstruktioner
- Ändra kärnans standardavvikelse till
2.5 - Sätt
alphaför rugploten till0.05 - Ändra
subtitletill"Gaussian kernel SD = 2.5"för att återspegla den nya kärnbredden.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
ggplot(md_speeding, aes(x = percentage_over_limit)) +
# Increase bin width to 2.5
geom_density(fill = 'steelblue', bw = 1, alpha = 0.7) +
# lower rugplot alpha to 0.05
geom_rug(alpha = 0.5) +
labs(
title = 'Distribution of % over speed limit',
# modify subtitle to reflect change in kernel width
subtitle = "Gaussian kernel SD = 1"
)