CommencezCommencez gratuitement

Recode de variables et calcul de totaux par groupe

dplyr, l'un des principaux forfaits du tidyverse, comprend de nombreuses fonctions pour le traitement des données. Cette boîte à outils permet de recoder des jeux de données, de définir des groupes à l'intérieur de ces jeux de données et d'effectuer des calculs par groupe. Ces opérations se font couramment dans un enchaînement avec un conduit, indiqué par l'opérateur %>%.

Dans cet exercice, vous allez travailler avec des données de l'ACS dans un tel enchaînement tidyverse. Vous identifierez les variables du revenu médian des ménages de la table ACS B19001 qui sont inférieures à 35 000 \(, entre 35 000 \) et 75 000 \(, et supérieures à 75 000 \). Vous dresserez ensuite un tableau du nombre de ménages qui appartiennent à chaque groupe pour les comtés de l'État de Washington.

Cette activité fait partie du cours

Analyser les données du recensement des États-Unis avec R

Voir le cours

Instructions de l’exercice

  • Filtrez les lignes où la variable est égale à "B19001_001", puisqu'elle représente le nombre total de ménages.
  • Utilisez la fonction case_when() pour créer une colonne nommée incgroup, que vous utiliserez pour définir les groupes recodés.
  • Utilisez la fonction group_by() pour regrouper votre jeu de données par nom de comté et par groupe de revenu.
  • Enfin, utilisez la fonction summarize() pour dresser le total par groupe et par comté, puis vérifiez le résultat.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Use a tidy workflow to wrangle ACS data
wa_grouped <- wa_income %>%
  ___(___ != "B19001_001") %>%
  mutate(incgroup = ___(
    variable < "B19001_008" ~ "below35k", 
    variable < "B19001_013" ~ "35kto75k", 
    TRUE ~ "above75k"
  )) %>%
  ___(NAME, incgroup) %>%
  ___(group_est = sum(estimate))

wa_grouped
Modifier et exécuter le code