Recodificar variables y calcular sumas por grupo
dplyr, uno de los paquetes fundamentales del tidyverse, incluye numerosas funciones para transformar datos. Esta funcionalidad te permite recodificar conjuntos de datos, definir grupos dentro de esos datos y realizar cálculos sobre esos grupos. Estas operaciones suelen hacerse dentro de una tubería (pipe), indicada con el operador %>%.
En este ejercicio, trabajarás con datos del ACS en un flujo de trabajo típico del tidyverse. Identificarás variables de ingresos familiares medianos en la tabla B19001 del ACS que estén por debajo de 35 000 \(, entre 35 000 y 75 000 \), y por encima de 75 000 $. Después, tabularás el número de hogares que caen en cada grupo para los condados de Washington.
Este ejercicio forma parte del curso
Análisis de datos del censo de EE. UU. en R
Instrucciones del ejercicio
- Filtra las filas donde la variable sea igual a
"B19001_001", ya que representa el número total de hogares. - Usa la función
case_when()para generar una columna llamadaincgroup, que usarás para definir los grupos recodificados. - Usa la función
group_by()para agrupar tu conjunto de datos por nombre del condado y grupo de ingresos. - Por último, usa la función
summarize()para tabular las sumas por grupo y condado, y luego revisa el resultado.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Use a tidy workflow to wrangle ACS data
wa_grouped <- wa_income %>%
___(___ != "B19001_001") %>%
mutate(incgroup = ___(
variable < "B19001_008" ~ "below35k",
variable < "B19001_013" ~ "35kto75k",
TRUE ~ "above75k"
)) %>%
___(NAME, incgroup) %>%
___(group_est = sum(estimate))
wa_grouped