Kom igångKom igång gratis

Slå ihop nivåer

Om det var svårt att arbeta med den kraftiga skevheten i exclaim_mess, är antalet bilagor i varje e-post (image) en ännu större utmaning. Kör följande kod i konsolen för att få en uppfattning om fördelningen:

table(email$image)

Kom ihåg att detta visar antalet fall i varje kategori (det fanns till exempel 3 811 e-postmeddelanden med 0 bilder). Eftersom antalet observationer är mycket lågt för högre bildantal ska vi slå ihop image till en kategorisk variabel som anger om e-postmeddelandet innehöll minst en bild eller inte. I den här övningen skapar du den nya variabeln och undersöker dess samband med skräppost.

Den här övningen är en del av kursen

Exploratory Data Analysis in R

Visa kurs

Övningsinstruktioner

Börja med email och bygg en sammanhängande kedja som utför följande steg:

  • Skapa en ny variabel med namnet has_image som är TRUE när antalet bilder är större än noll, och FALSE annars.
  • Skapa ett lämpligt diagram med email för att visualisera sambandet mellan has_image och spam.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Create plot of proportion of spam by image
email %>%
  mutate(has_image = ___) %>%
  ggplot(aes(x = ___, fill = ___)) +
  geom_bar(position = ___)
Redigera och kör kod