Kom igångKom igång gratis

Besvara frågor med kedjor

När du har en specifik fråga om en datamängd kan du hitta svaret genom att bygga upp en lämplig kedja av R-kod. Ta till exempel följande fråga: "Bland e-post som inte är skräppost – är de typiska e-postmeddelandena kortare när de skickats till flera mottagare?"

Detta kan besvaras med följande kedja:

email %>%
   filter(spam == "not-spam") %>%
   group_by(to_multiple) %>%
   summarize(median(num_char))

Koden visar tydligt att num_char används för att mäta e-postlängden och median() för att beskriva det typiska värdet. Om du kör koden ser du att svaret är "ja": typiska icke-skräppostmeddelanden som skickats till flera mottagare är något kortare än de som skickats till en enda person.

Den här kedjan avslutades med sammanfattande statistik, men andra kedjor kan avslutas med ett diagram – det beror helt på vilken fråga du försöker besvara.

Den här övningen är en del av kursen

Exploratory Data Analysis in R

Visa kurs

Övningsinstruktioner

Bygg en kedja för att besvara var och en av följande frågor, båda om variabeln dollar.

  • Innehåller det typiska skräppostmeddelandet fler förekomster av ordet "dollar" än det typiska icke-skräppostmeddelandet, bland e-post som innehåller ordet? Skapa en sammanfattande statistik som besvarar frågan.
  • Om du stöter på ett e-postmeddelande med fler än 10 förekomster av ordet dollar – är det då troligare att det är skräppost eller inte? Skapa ett stapeldiagram som besvarar frågan.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Question 1
email %>%
  filter(___) %>%
  group_by(___) %>%
  summarize(___)

# Question 2
email %>%
  filter(___) %>%
  ggplot(aes(x = ___)) +
  geom_bar()
Redigera och kör kod