Recodificarea variabilelor și calculul sumelor pe grupuri
dplyr, unul dintre pachetele de bază din tidyverse, include numeroase funcții pentru prelucrarea datelor. Acestea îți permit să recodifici seturi de date, să definești grupuri în cadrul lor și să efectuezi calcule pe acele grupuri. Astfel de operațiuni au loc de obicei într-un pipe, notat cu operatorul %>%.
În acest exercițiu, vei lucra cu date ACS într-un astfel de flux de lucru tidyverse. Vei identifica variabilele privind venitul median al gospodăriilor din tabelul ACS B19001 care sunt sub 35.000 \(; între 35.000 \) și 75.000 \(; și peste 75.000 \). Vei calcula apoi numărul de gospodării care se încadrează în fiecare grup, pentru județele din Washington.
Acest exercițiu face parte din cursul
Analiza datelor recensământului SUA în R
Instrucțiuni pentru exercițiu
- Filtrează rândurile în care variabila este egală cu
"B19001_001", deoarece aceasta reprezintă numărul total de gospodării. - Folosește funcția
case_when()pentru a genera o coloană numităincgroup, pe care o vei utiliza pentru a defini grupurile recodificate. - Folosește funcția
group_by()pentru a grupa setul de date după numele județului și grupul de venit. - În final, folosește funcția
summarize()pentru a totaliza sumele pe grupuri pentru fiecare județ, apoi verifică rezultatul.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Use a tidy workflow to wrangle ACS data
wa_grouped <- wa_income %>%
___(___ != "B19001_001") %>%
mutate(incgroup = ___(
variable < "B19001_008" ~ "below35k",
variable < "B19001_013" ~ "35kto75k",
TRUE ~ "above75k"
)) %>%
___(NAME, incgroup) %>%
___(group_est = sum(estimate))
wa_grouped