Mulai sekarangMulai gratis

Menyandikan ulang variabel dan menghitung jumlah per grup

dplyr, salah satu paket inti dalam tidyverse, mencakup banyak fungsi untuk penataan data. Fungsionalitas ini memungkinkan pengguna menyandikan ulang himpunan data, menentukan grup dalam himpunan data tersebut, dan melakukan perhitungan pada grup-grup itu. Operasi seperti ini umum dilakukan dalam sebuah pipe yang ditandai dengan operator %>%.

Dalam latihan ini, Anda akan bekerja dengan data ACS dalam alur kerja tidyverse seperti itu. Anda akan mengidentifikasi variabel pendapatan rumah tangga median pada tabel ACS B19001 yang berada di bawah $35.000; antara $35.000 hingga $75.000; dan di atas $75.000. Setelah itu, Anda akan membuat tabulasi jumlah rumah tangga yang termasuk dalam setiap grup untuk county di Washington.

Latihan ini merupakan bagian dari kursus

Menganalisis Data Sensus AS di R

Lihat Kursus

Instruksi latihan

  • Saring baris yang variabelnya sama dengan "B19001_001", karena ini merepresentasikan total jumlah rumah tangga.
  • Gunakan fungsi case_when() untuk membuat kolom bernama incgroup, yang akan Anda gunakan untuk mendefinisikan grup hasil penyandian ulang.
  • Gunakan fungsi group_by() untuk mengelompokkan himpunan data berdasarkan nama county dan grup pendapatan.
  • Terakhir, gunakan fungsi summarize() untuk menabulasi jumlah per grup menurut county, lalu periksa hasilnya.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Use a tidy workflow to wrangle ACS data
wa_grouped <- wa_income %>%
  ___(___ != "B19001_001") %>%
  mutate(incgroup = ___(
    variable < "B19001_008" ~ "below35k", 
    variable < "B19001_013" ~ "35kto75k", 
    TRUE ~ "above75k"
  )) %>%
  ___(NAME, incgroup) %>%
  ___(group_est = sum(estimate))

wa_grouped
Edit dan Jalankan Kode