Menyandikan ulang variabel dan menghitung jumlah per grup
dplyr, salah satu paket inti dalam tidyverse, mencakup banyak fungsi untuk penataan data. Fungsionalitas ini memungkinkan pengguna menyandikan ulang himpunan data, menentukan grup dalam himpunan data tersebut, dan melakukan perhitungan pada grup-grup itu. Operasi seperti ini umum dilakukan dalam sebuah pipe yang ditandai dengan operator %>%.
Dalam latihan ini, Anda akan bekerja dengan data ACS dalam alur kerja tidyverse seperti itu. Anda akan mengidentifikasi variabel pendapatan rumah tangga median pada tabel ACS B19001 yang berada di bawah $35.000; antara $35.000 hingga $75.000; dan di atas $75.000. Setelah itu, Anda akan membuat tabulasi jumlah rumah tangga yang termasuk dalam setiap grup untuk county di Washington.
Latihan ini merupakan bagian dari kursus
Menganalisis Data Sensus AS di R
Instruksi latihan
- Saring baris yang variabelnya sama dengan
"B19001_001", karena ini merepresentasikan total jumlah rumah tangga. - Gunakan fungsi
case_when()untuk membuat kolom bernamaincgroup, yang akan Anda gunakan untuk mendefinisikan grup hasil penyandian ulang. - Gunakan fungsi
group_by()untuk mengelompokkan himpunan data berdasarkan nama county dan grup pendapatan. - Terakhir, gunakan fungsi
summarize()untuk menabulasi jumlah per grup menurut county, lalu periksa hasilnya.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Use a tidy workflow to wrangle ACS data
wa_grouped <- wa_income %>%
___(___ != "B19001_001") %>%
mutate(incgroup = ___(
variable < "B19001_008" ~ "below35k",
variable < "B19001_013" ~ "35kto75k",
TRUE ~ "above75k"
)) %>%
___(NAME, incgroup) %>%
___(group_est = sum(estimate))
wa_grouped