Memilih kolom
Cara termudah untuk memanipulasi data frame yang disimpan di Spark adalah menggunakan sintaks dplyr. Manipulasi data frame dengan sintaks dplyr dibahas secara mendalam dalam kursus Data Manipulation with dplyr dan Joining Data with dplyr, tetapi Anda akan menghabiskan satu setengah bab berikutnya untuk membahas semua poin pentingnya.
dplyr memiliki lima aksi utama yang dapat Anda lakukan pada sebuah data frame. Anda dapat memilih kolom, memfilter baris, mengatur urutan baris, mengubah kolom atau menambahkan kolom baru, serta menghitung statistik ringkasan.
Mari mulai dengan memilih kolom. Ini dilakukan dengan memanggil select(), dengan sebuah tibble, diikuti nama kolom (tanpa tanda kutip) yang ingin Anda pertahankan. Fungsi dplyr lazimnya digunakan bersama operator pipe dari magrittr, %>%. Untuk memilih kolom x, y, dan z, Anda akan menulis kode berikut.
a_tibble %>%
select(x, y, z)
Perhatikan bahwa pengindeksan dengan tanda kurung siku saat ini belum didukung di sparklyr. Jadi Anda tidak dapat melakukan
a_tibble[, c("x", "y", "z")]
Latihan ini merupakan bagian dari kursus
Pengantar Spark dengan sparklyr di R
Instruksi latihan
Sambungan Spark telah dibuat untuk Anda sebagai spark_conn. Sebuah tibble yang terhubung ke metadata trek yang disimpan di Spark telah didefinisikan sebelumnya sebagai track_metadata_tbl.
- Pilih
artist_name,release,title, danyearmenggunakanselect(). - Cobalah melakukan hal yang sama menggunakan pengindeksan tanda kurung siku. Spoiler! Kode ini akan menimbulkan error, sehingga dibungkus dalam pemanggilan
tryCatch().
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Manipulate the track metadata
track_metadata_tbl %>%
# Select columns
___
# Try to select columns using [ ]
tryCatch({
# Selection code here
___
},
error = print
)