Slå ihop nivåer
Om det var svårt att arbeta med den kraftiga skevheten i exclaim_mess, är antalet bilagor i varje e-post (image) en ännu större utmaning. Kör följande kod i konsolen för att få en uppfattning om fördelningen:
table(email$image)
Kom ihåg att detta visar antalet fall i varje kategori (det fanns till exempel 3 811 e-postmeddelanden med 0 bilder). Eftersom antalet observationer är mycket lågt för högre bildantal ska vi slå ihop image till en kategorisk variabel som anger om e-postmeddelandet innehöll minst en bild eller inte. I den här övningen skapar du den nya variabeln och undersöker dess samband med skräppost.
Den här övningen är en del av kursen
Exploratory Data Analysis in R
Övningsinstruktioner
Börja med email och bygg en sammanhängande kedja som utför följande steg:
- Skapa en ny variabel med namnet
has_imagesom ärTRUEnär antalet bilder är större än noll, ochFALSEannars. - Skapa ett lämpligt diagram med
emailför att visualisera sambandet mellanhas_imageochspam.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Create plot of proportion of spam by image
email %>%
mutate(has_image = ___) %>%
ggplot(aes(x = ___, fill = ___)) +
geom_bar(position = ___)