Recodificando variáveis e calculando somas por grupo
O dplyr, um dos pacotes centrais do tidyverse, inclui diversas funções para manipulação de dados. Essa funcionalidade permite recodificar conjuntos de dados, definir grupos dentro desses conjuntos e realizar cálculos nesses grupos. Essas operações geralmente acontecem dentro de um pipe, indicado pelo operador %>%.
Neste exercício, você vai trabalhar com dados da ACS em um fluxo de trabalho típico do tidyverse. Você irá identificar variáveis de renda familiar mediana na tabela B19001 da ACS que estejam abaixo de US\( 35.000; entre US\) 35.000 e US\( 75.000; e acima de US\) 75.000. Em seguida, vai tabular o número de domicílios que se enquadram em cada grupo para os condados em Washington.
Este exercicio faz parte do curso
Analisando dados do Censo dos EUA em R
Instruções do exercicio
- Filtre as linhas em que a variável é igual a
"B19001_001", pois isso representa o número total de domicílios. - Use a função
case_when()para gerar uma coluna chamadaincgroup, que você usará para definir os grupos recodificados. - Use a função
group_by()para agrupar seu conjunto de dados por nome do condado e grupo de renda. - Por fim, use a função
summarize()para tabular as somas por grupo em cada condado e, então, confira o resultado.
exercicio interativo prático
Tente este exercicio completando este código de exemplo.
# Use a tidy workflow to wrangle ACS data
wa_grouped <- wa_income %>%
___(___ != "B19001_001") %>%
mutate(incgroup = ___(
variable < "B19001_008" ~ "below35k",
variable < "B19001_013" ~ "35kto75k",
TRUE ~ "above75k"
)) %>%
___(NAME, incgroup) %>%
___(group_est = sum(estimate))
wa_grouped