Inizia subitoInizia gratis

Ricodificare variabili e calcolare somme per gruppo

dplyr, uno dei pacchetti principali del tidyverse, include numerose funzioni per la manipolazione dei dati. Questa funzionalità ti permette di ricodificare insiemi di dati, definire gruppi al loro interno ed eseguire calcoli su quei gruppi. Operazioni di questo tipo avvengono comunemente all'interno di una pipe, indicata con l'operatore %>%.

In questo esercizio lavorerai con dati ACS proprio in un flusso di lavoro tidyverse. Identificherai le variabili del reddito familiare mediano nella tabella ACS B19001 che sono inferiori a $35.000; tra $35.000 e $75.000; e superiori a $75.000. Poi conterai il numero di famiglie che rientrano in ciascun gruppo per le contee dello stato di Washington.

Questo esercizio fa parte del corso

Analizzare i dati del Censimento USA in R

Visualizza corso

Istruzioni dell'esercizio

  • Filtra le righe in cui la variabile è uguale a "B19001_001", poiché rappresenta il numero totale di famiglie.
  • Usa la funzione case_when() per generare una colonna chiamata incgroup, che userai per definire i gruppi ricodificati.
  • Usa la funzione group_by() per raggruppare il tuo insieme di dati per nome della contea e gruppo di reddito.
  • Infine, usa la funzione summarize() per tabulare le somme per gruppo per contea, quindi verifica il risultato.

esercizio interattivo pratico

Prova questo esercizio completando questo codice di esempio.

# Use a tidy workflow to wrangle ACS data
wa_grouped <- wa_income %>%
  ___(___ != "B19001_001") %>%
  mutate(incgroup = ___(
    variable < "B19001_008" ~ "below35k", 
    variable < "B19001_013" ~ "35kto75k", 
    TRUE ~ "above75k"
  )) %>%
  ___(NAME, incgroup) %>%
  ___(group_est = sum(estimate))

wa_grouped
Modifica ed esegui il codice