ÎncepețiÎncepe gratuit

Reducerea nivelurilor

Dacă lucrul cu distribuția puternic asimetrică a variabilei exclaim_mess a fost dificil, variabila image – numărul de imagini atașate fiecărui e-mail – ridică o provocare și mai mare. Rulează următorul cod în consolă pentru a-ți face o idee despre distribuția sa:

table(email$image)

Amintește-ți că această funcție numără câte observații există în fiecare categorie (de exemplu, au existat 3.811 e-mailuri cu 0 imagini). Dat fiind că frecvențele sunt foarte mici la valori mai mari ale numărului de imagini, hai să transformăm image într-o variabilă categorică care să indice dacă e-mailul conține sau nu cel puțin o imagine. În acest exercițiu, vei crea această nouă variabilă și vei explora relația ei cu spam-ul.

Acest exercițiu face parte din cursul

Exploratory Data Analysis în R

Vezi cursul

Instrucțiuni pentru exercițiu

Pornind de la email, construiește un lanț continuu care să îndeplinească următoarele sarcini:

  • Creează o nouă variabilă numită has_image, care să fie TRUE dacă numărul de imagini este mai mare decât zero și FALSE în caz contrar.
  • Creează un grafic potrivit pe baza setului de date email pentru a vizualiza relația dintre has_image și spam.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Create plot of proportion of spam by image
email %>%
  mutate(has_image = ___) %>%
  ggplot(aes(x = ___, fill = ___)) +
  geom_bar(position = ___)
Editează și rulează codul