Recode de variables et calcul de totaux par groupe
dplyr, l'un des principaux forfaits du tidyverse, comprend de nombreuses fonctions pour le traitement des données. Cette boîte à outils permet de recoder des jeux de données, de définir des groupes à l'intérieur de ces jeux de données et d'effectuer des calculs par groupe. Ces opérations se font couramment dans un enchaînement avec un conduit, indiqué par l'opérateur %>%.
Dans cet exercice, vous allez travailler avec des données de l'ACS dans un tel enchaînement tidyverse. Vous identifierez les variables du revenu médian des ménages de la table ACS B19001 qui sont inférieures à 35 000 \(, entre 35 000 \) et 75 000 \(, et supérieures à 75 000 \). Vous dresserez ensuite un tableau du nombre de ménages qui appartiennent à chaque groupe pour les comtés de l'État de Washington.
Cette activité fait partie du cours
Analyser les données du recensement des États-Unis avec R
Instructions de l’exercice
- Filtrez les lignes où la variable est égale à
"B19001_001", puisqu'elle représente le nombre total de ménages. - Utilisez la fonction
case_when()pour créer une colonne nomméeincgroup, que vous utiliserez pour définir les groupes recodés. - Utilisez la fonction
group_by()pour regrouper votre jeu de données par nom de comté et par groupe de revenu. - Enfin, utilisez la fonction
summarize()pour dresser le total par groupe et par comté, puis vérifiez le résultat.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Use a tidy workflow to wrangle ACS data
wa_grouped <- wa_income %>%
___(___ != "B19001_001") %>%
mutate(incgroup = ___(
variable < "B19001_008" ~ "below35k",
variable < "B19001_013" ~ "35kto75k",
TRUE ~ "above75k"
)) %>%
___(NAME, incgroup) %>%
___(group_est = sum(estimate))
wa_grouped