Variabelen hercoderen en groepssommen berekenen
dplyr, een van de kernpakketten binnen de tidyverse, bevat tal van functies voor datamanipulatie. Deze functionaliteit stelt je in staat om gegevenssets te hercoderen, groepen binnen die gegevenssets te definiëren en berekeningen over die groepen uit te voeren. Zulke bewerkingen vinden vaak plaats binnen een pipe, aangeduid met de operator %>%.
In deze oefening werk je met ACS-gegevens in precies zo'n tidyverse-workflow. Je gaat mediane inkomensvariabelen van huishoudens in ACS-tabel B19001 identificeren die onder $35.000 vallen; tussen $35.000 en $75.000; en boven $75.000. Vervolgens tel je het aantal huishoudens dat in elke groep valt voor counties in Washington.
Deze oefening maakt deel uit van de cursus
US Census-gegevens analyseren in R
Oefeninstructies
- Filter rijen weg waar de variabele gelijk is aan
"B19001_001", want dit staat voor het totale aantal huishoudens. - Gebruik de functie
case_when()om een kolomincgroupte maken, die je gebruikt om de hercodeerde groepen te definiëren. - Gebruik de functie
group_by()om je gegevensset te groeperen op county-naam en inkomensgroep. - Gebruik tot slot de functie
summarize()om groepssommen per county te berekenen en controleer dan het resultaat.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Use a tidy workflow to wrangle ACS data
wa_grouped <- wa_income %>%
___(___ != "B19001_001") %>%
mutate(incgroup = ___(
variable < "B19001_008" ~ "below35k",
variable < "B19001_013" ~ "35kto75k",
TRUE ~ "above75k"
)) %>%
___(NAME, incgroup) %>%
___(group_est = sum(estimate))
wa_grouped