Překódování proměnných a výpočet skupinových součtů
dplyr, jeden z klíčových balíčků tidyverse, nabízí řadu funkcí pro práci s daty. Umožňuje překódovávat datové sady, definovat v nich skupiny a provádět výpočty nad těmito skupinami. Takové operace se běžně řetězí pomocí roury, označené operátorem %>%.
V tomto cvičení budeš pracovat s daty ACS v typickém tidyverse workflow. Identifikuješ proměnné mediánového příjmu domácností z tabulky ACS B19001, které jsou nižší než 35 000 \(, mezi 35 000 \) a 75 000 \( a nad 75 000 \). Potom spočítáš, kolik domácností spadá do každé skupiny pro jednotlivé okresy ve Washingtonu.
Toto cvičení je součástí kurzu
Analýza dat amerického sčítání lidu v R
Pokyny k cvičení
- Odfiltruj řádky, kde se proměnná rovná
"B19001_001"– ta totiž představuje celkový počet domácností. - Pomocí funkce
case_when()vytvoř sloupecincgroup, který použiješ k definování překódovaných skupin. - Pomocí funkce
group_by()seskup datovou sadu podle názvu okresu a příjmové skupiny. - Nakonec použij funkci
summarize()k výpočtu skupinových součtů podle okresu a zkontroluj výsledek.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Use a tidy workflow to wrangle ACS data
wa_grouped <- wa_income %>%
___(___ != "B19001_001") %>%
mutate(incgroup = ___(
variable < "B19001_008" ~ "below35k",
variable < "B19001_013" ~ "35kto75k",
TRUE ~ "above75k"
)) %>%
___(NAME, incgroup) %>%
___(group_est = sum(estimate))
wa_grouped