Mulai sekarangMulai gratis

Memilih kolom

Cara termudah untuk memanipulasi data frame yang disimpan di Spark adalah menggunakan sintaks dplyr. Manipulasi data frame dengan sintaks dplyr dibahas secara mendalam dalam kursus Data Manipulation with dplyr dan Joining Data with dplyr, tetapi Anda akan menghabiskan satu setengah bab berikutnya untuk membahas semua poin pentingnya.

dplyr memiliki lima aksi utama yang dapat Anda lakukan pada sebuah data frame. Anda dapat memilih kolom, memfilter baris, mengatur urutan baris, mengubah kolom atau menambahkan kolom baru, serta menghitung statistik ringkasan.

Mari mulai dengan memilih kolom. Ini dilakukan dengan memanggil select(), dengan sebuah tibble, diikuti nama kolom (tanpa tanda kutip) yang ingin Anda pertahankan. Fungsi dplyr lazimnya digunakan bersama operator pipe dari magrittr, %>%. Untuk memilih kolom x, y, dan z, Anda akan menulis kode berikut.

a_tibble %>%
  select(x, y, z)

Perhatikan bahwa pengindeksan dengan tanda kurung siku saat ini belum didukung di sparklyr. Jadi Anda tidak dapat melakukan

a_tibble[, c("x", "y", "z")]

Latihan ini merupakan bagian dari kursus

Pengantar Spark dengan sparklyr di R

Lihat Kursus

Instruksi latihan

Sambungan Spark telah dibuat untuk Anda sebagai spark_conn. Sebuah tibble yang terhubung ke metadata trek yang disimpan di Spark telah didefinisikan sebelumnya sebagai track_metadata_tbl.

  • Pilih artist_name, release, title, dan year menggunakan select().
  • Cobalah melakukan hal yang sama menggunakan pengindeksan tanda kurung siku. Spoiler! Kode ini akan menimbulkan error, sehingga dibungkus dalam pemanggilan tryCatch().

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Manipulate the track metadata
track_metadata_tbl %>%
  # Select columns
  ___

# Try to select columns using [ ]
tryCatch({
    # Selection code here
    ___
  },
  error = print
)
Edit dan Jalankan Kode