Kom igångKom igång gratis

Koda om variabler och beräkna gruppsummor

dplyr, ett av kärnpaketen i tidyverse, innehåller många funktioner för datarensning. Med dessa kan du koda om datamängder, definiera grupper inom dem och utföra beräkningar över grupperna. Sådana operationer sker ofta i ett pipe-flöde med operatorn %>%.

I den här övningen arbetar du med ACS-data i ett sådant tidyverse-arbetsflöde. Du identifierar variabler för medianinkomst per hushåll i ACS-tabell B19001 som är under 35 000 dollar, mellan 35 000 och 75 000 dollar, respektive över 75 000 dollar. Sedan summerar du antalet hushåll som faller inom varje grupp för countyn i Washington.

Den här övningen är en del av kursen

Analysera folkräkningsdata från USA i R

Visa kurs

Övningsinstruktioner

  • Filtrera bort rader där variabeln är lika med "B19001_001", eftersom den representerar det totala antalet hushåll.
  • Använd funktionen case_when() för att skapa en kolumn med namnet incgroup, som du använder för att definiera de omkodade grupperna.
  • Använd funktionen group_by() för att gruppera din datamängd efter countyns namn och inkomstgrupp.
  • Använd slutligen funktionen summarize() för att summera grupperna per county och kontrollera sedan resultatet.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Use a tidy workflow to wrangle ACS data
wa_grouped <- wa_income %>%
  ___(___ != "B19001_001") %>%
  mutate(incgroup = ___(
    variable < "B19001_008" ~ "below35k", 
    variable < "B19001_013" ~ "35kto75k", 
    TRUE ~ "above75k"
  )) %>%
  ___(NAME, incgroup) %>%
  ___(group_est = sum(estimate))

wa_grouped
Redigera och kör kod