Koda om variabler och beräkna gruppsummor
dplyr, ett av kärnpaketen i tidyverse, innehåller många funktioner för datarensning. Med dessa kan du koda om datamängder, definiera grupper inom dem och utföra beräkningar över grupperna. Sådana operationer sker ofta i ett pipe-flöde med operatorn %>%.
I den här övningen arbetar du med ACS-data i ett sådant tidyverse-arbetsflöde. Du identifierar variabler för medianinkomst per hushåll i ACS-tabell B19001 som är under 35 000 dollar, mellan 35 000 och 75 000 dollar, respektive över 75 000 dollar. Sedan summerar du antalet hushåll som faller inom varje grupp för countyn i Washington.
Den här övningen är en del av kursen
Analysera folkräkningsdata från USA i R
Övningsinstruktioner
- Filtrera bort rader där variabeln är lika med
"B19001_001", eftersom den representerar det totala antalet hushåll. - Använd funktionen
case_when()för att skapa en kolumn med namnetincgroup, som du använder för att definiera de omkodade grupperna. - Använd funktionen
group_by()för att gruppera din datamängd efter countyns namn och inkomstgrupp. - Använd slutligen funktionen
summarize()för att summera grupperna per county och kontrollera sedan resultatet.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Use a tidy workflow to wrangle ACS data
wa_grouped <- wa_income %>%
___(___ != "B19001_001") %>%
mutate(incgroup = ___(
variable < "B19001_008" ~ "below35k",
variable < "B19001_013" ~ "35kto75k",
TRUE ~ "above75k"
)) %>%
___(NAME, incgroup) %>%
___(group_est = sum(estimate))
wa_grouped