Slučování kategorií
Pokud ti přišla práce se silně zešikmeným rozdělením proměnné exclaim_mess náročná, proměnná image — tedy počet obrázků připojených k e-mailu — představuje ještě větší výzvu. Spusť v konzoli následující kód, abys získal/a představu o jejím rozdělení:
table(email$image)
Tento příkaz spočítá počet případů v každé kategorii (například e-mailů bez obrázků bylo 3 811). Protože vyšší počty obrázků mají velmi nízké frekvence, sloučíme proměnnou image do kategorické proměnné, která bude říkat, jestli e-mail obsahoval alespoň jeden obrázek. V tomto cvičení tuto novou proměnnou vytvoříš a prozkoumáš její vztah se spamem.
Toto cvičení je součástí kurzu
Exploratory Data Analysis in R
Pokyny k cvičení
Začni s datasetem email a vytvoř kontinuální řetězec operací, který splní následující úkoly:
- Vytvoř novou proměnnou
has_image, která bude mít hodnotuTRUE, pokud je počet obrázků větší než nula, aFALSEv ostatních případech. - Vytvoř vhodný graf z datasetu
email, který zobrazí vztah mezi proměnnouhas_imagea proměnnouspam.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create plot of proportion of spam by image
email %>%
mutate(has_image = ___) %>%
ggplot(aes(x = ___, fill = ___)) +
geom_bar(position = ___)