Reducerea nivelurilor
Dacă lucrul cu distribuția puternic asimetrică a variabilei exclaim_mess a fost dificil, variabila image – numărul de imagini atașate fiecărui e-mail – ridică o provocare și mai mare. Rulează următorul cod în consolă pentru a-ți face o idee despre distribuția sa:
table(email$image)
Amintește-ți că această funcție numără câte observații există în fiecare categorie (de exemplu, au existat 3.811 e-mailuri cu 0 imagini). Dat fiind că frecvențele sunt foarte mici la valori mai mari ale numărului de imagini, hai să transformăm image într-o variabilă categorică care să indice dacă e-mailul conține sau nu cel puțin o imagine. În acest exercițiu, vei crea această nouă variabilă și vei explora relația ei cu spam-ul.
Acest exercițiu face parte din cursul
Exploratory Data Analysis în R
Instrucțiuni pentru exercițiu
Pornind de la email, construiește un lanț continuu care să îndeplinească următoarele sarcini:
- Creează o nouă variabilă numită
has_image, care să fieTRUEdacă numărul de imagini este mai mare decât zero șiFALSEîn caz contrar. - Creează un grafic potrivit pe baza setului de date
emailpentru a vizualiza relația dintrehas_imageșispam.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create plot of proportion of spam by image
email %>%
mutate(has_image = ___) %>%
ggplot(aes(x = ___, fill = ___)) +
geom_bar(position = ___)