Ricodificare variabili e calcolare somme per gruppo
dplyr, uno dei pacchetti principali del tidyverse, include numerose funzioni per la manipolazione dei dati. Questa funzionalità ti permette di ricodificare insiemi di dati, definire gruppi al loro interno ed eseguire calcoli su quei gruppi. Operazioni di questo tipo avvengono comunemente all'interno di una pipe, indicata con l'operatore %>%.
In questo esercizio lavorerai con dati ACS proprio in un flusso di lavoro tidyverse. Identificherai le variabili del reddito familiare mediano nella tabella ACS B19001 che sono inferiori a $35.000; tra $35.000 e $75.000; e superiori a $75.000. Poi conterai il numero di famiglie che rientrano in ciascun gruppo per le contee dello stato di Washington.
Questo esercizio fa parte del corso
Analizzare i dati del Censimento USA in R
Istruzioni dell'esercizio
- Filtra le righe in cui la variabile è uguale a
"B19001_001", poiché rappresenta il numero totale di famiglie. - Usa la funzione
case_when()per generare una colonna chiamataincgroup, che userai per definire i gruppi ricodificati. - Usa la funzione
group_by()per raggruppare il tuo insieme di dati per nome della contea e gruppo di reddito. - Infine, usa la funzione
summarize()per tabulare le somme per gruppo per contea, quindi verifica il risultato.
esercizio interattivo pratico
Prova questo esercizio completando questo codice di esempio.
# Use a tidy workflow to wrangle ACS data
wa_grouped <- wa_income %>%
___(___ != "B19001_001") %>%
mutate(incgroup = ___(
variable < "B19001_008" ~ "below35k",
variable < "B19001_013" ~ "35kto75k",
TRUE ~ "above75k"
)) %>%
___(NAME, incgroup) %>%
___(group_est = sum(estimate))
wa_grouped