ÎncepețiÎncepe gratuit

Recodificarea variabilelor și calculul sumelor pe grupuri

dplyr, unul dintre pachetele de bază din tidyverse, include numeroase funcții pentru prelucrarea datelor. Acestea îți permit să recodifici seturi de date, să definești grupuri în cadrul lor și să efectuezi calcule pe acele grupuri. Astfel de operațiuni au loc de obicei într-un pipe, notat cu operatorul %>%.

În acest exercițiu, vei lucra cu date ACS într-un astfel de flux de lucru tidyverse. Vei identifica variabilele privind venitul median al gospodăriilor din tabelul ACS B19001 care sunt sub 35.000 \(; între 35.000 \) și 75.000 \(; și peste 75.000 \). Vei calcula apoi numărul de gospodării care se încadrează în fiecare grup, pentru județele din Washington.

Acest exercițiu face parte din cursul

Analiza datelor recensământului SUA în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Filtrează rândurile în care variabila este egală cu "B19001_001", deoarece aceasta reprezintă numărul total de gospodării.
  • Folosește funcția case_when() pentru a genera o coloană numită incgroup, pe care o vei utiliza pentru a defini grupurile recodificate.
  • Folosește funcția group_by() pentru a grupa setul de date după numele județului și grupul de venit.
  • În final, folosește funcția summarize() pentru a totaliza sumele pe grupuri pentru fiecare județ, apoi verifică rezultatul.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Use a tidy workflow to wrangle ACS data
wa_grouped <- wa_income %>%
  ___(___ != "B19001_001") %>%
  mutate(incgroup = ___(
    variable < "B19001_008" ~ "below35k", 
    variable < "B19001_013" ~ "35kto75k", 
    TRUE ~ "above75k"
  )) %>%
  ___(NAME, incgroup) %>%
  ___(group_est = sum(estimate))

wa_grouped
Editează și rulează codul