Aan de slagBegin gratis

Variabelen hercoderen en groepssommen berekenen

dplyr, een van de kernpakketten binnen de tidyverse, bevat tal van functies voor datamanipulatie. Deze functionaliteit stelt je in staat om gegevenssets te hercoderen, groepen binnen die gegevenssets te definiëren en berekeningen over die groepen uit te voeren. Zulke bewerkingen vinden vaak plaats binnen een pipe, aangeduid met de operator %>%.

In deze oefening werk je met ACS-gegevens in precies zo'n tidyverse-workflow. Je gaat mediane inkomensvariabelen van huishoudens in ACS-tabel B19001 identificeren die onder $35.000 vallen; tussen $35.000 en $75.000; en boven $75.000. Vervolgens tel je het aantal huishoudens dat in elke groep valt voor counties in Washington.

Deze oefening maakt deel uit van de cursus

US Census-gegevens analyseren in R

Bekijk cursus

Oefeninstructies

  • Filter rijen weg waar de variabele gelijk is aan "B19001_001", want dit staat voor het totale aantal huishoudens.
  • Gebruik de functie case_when() om een kolom incgroup te maken, die je gebruikt om de hercodeerde groepen te definiëren.
  • Gebruik de functie group_by() om je gegevensset te groeperen op county-naam en inkomensgroep.
  • Gebruik tot slot de functie summarize() om groepssommen per county te berekenen en controleer dan het resultaat.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Use a tidy workflow to wrangle ACS data
wa_grouped <- wa_income %>%
  ___(___ != "B19001_001") %>%
  mutate(incgroup = ___(
    variable < "B19001_008" ~ "below35k", 
    variable < "B19001_013" ~ "35kto75k", 
    TRUE ~ "above75k"
  )) %>%
  ___(NAME, incgroup) %>%
  ___(group_est = sum(estimate))

wa_grouped
Code bewerken en uitvoeren