Začněte nyníZačněte zdarma

Překódování proměnných a výpočet skupinových součtů

dplyr, jeden z klíčových balíčků tidyverse, nabízí řadu funkcí pro práci s daty. Umožňuje překódovávat datové sady, definovat v nich skupiny a provádět výpočty nad těmito skupinami. Takové operace se běžně řetězí pomocí roury, označené operátorem %>%.

V tomto cvičení budeš pracovat s daty ACS v typickém tidyverse workflow. Identifikuješ proměnné mediánového příjmu domácností z tabulky ACS B19001, které jsou nižší než 35 000 \(, mezi 35 000 \) a 75 000 \( a nad 75 000 \). Potom spočítáš, kolik domácností spadá do každé skupiny pro jednotlivé okresy ve Washingtonu.

Toto cvičení je součástí kurzu

Analýza dat amerického sčítání lidu v R

Zobrazit kurz

Pokyny k cvičení

  • Odfiltruj řádky, kde se proměnná rovná "B19001_001" – ta totiž představuje celkový počet domácností.
  • Pomocí funkce case_when() vytvoř sloupec incgroup, který použiješ k definování překódovaných skupin.
  • Pomocí funkce group_by() seskup datovou sadu podle názvu okresu a příjmové skupiny.
  • Nakonec použij funkci summarize() k výpočtu skupinových součtů podle okresu a zkontroluj výsledek.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Use a tidy workflow to wrangle ACS data
wa_grouped <- wa_income %>%
  ___(___ != "B19001_001") %>%
  mutate(incgroup = ___(
    variable < "B19001_008" ~ "below35k", 
    variable < "B19001_013" ~ "35kto75k", 
    TRUE ~ "above75k"
  )) %>%
  ___(NAME, incgroup) %>%
  ___(group_est = sum(estimate))

wa_grouped
Upravit a spustit kód