Mengeksplorasi tipe data Spark
Anda sudah melihat (kembali di Bab 1) src_tbls() untuk mencantumkan DataFrame di Spark yang dapat dilihat oleh sparklyr. Anda juga telah melihat glimpse() untuk menelusuri kolom sebuah tibble di sisi R.
sparklyr memiliki fungsi bernama sdf_schema() untuk menelusuri kolom tibble di sisi R. Pemanggilannya mudah; namun nilai kembalian agak merepotkan untuk diolah.
sdf_schema(a_tibble)
Nilai kembalian adalah sebuah list, dan setiap elemennya merupakan list dengan dua elemen yang memuat nama dan tipe data tiap kolom. Latihan ini menampilkan sebuah transformasi data agar tipe data lebih mudah dilihat.
Berikut perbandingan bagaimana tipe data R dipetakan ke tipe data Spark. Tipe data lain saat ini belum didukung oleh sparklyr.
| R type | Spark type |
|---|---|
| logical | BooleanType |
| numeric | DoubleType |
| integer | IntegerType |
| character | StringType |
| list | ArrayType |
Latihan ini merupakan bagian dari kursus
Pengantar Spark dengan sparklyr di R
Instruksi latihan
Sebuah koneksi Spark telah dibuat untuk Anda sebagai spark_conn. Sebuah tibble yang terhubung ke metadata track yang disimpan di Spark telah didefinisikan sebelumnya sebagai track_metadata_tbl.
- Panggil
sdf_schema()untuk mendapatkan skema metadata track. - Jalankan kode transformasi pada
schemauntuk melihatnya dalam format tibble yang lebih mudah dibaca.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
# Get the schema
(schema <- ___(___))
# Transform the schema
schema %>%
lapply(function(x) do.call(data_frame, x)) %>%
bind_rows()