Mulai sekarangMulai gratis

Mengeksplorasi tipe data Spark

Anda sudah melihat (kembali di Bab 1) src_tbls() untuk mencantumkan DataFrame di Spark yang dapat dilihat oleh sparklyr. Anda juga telah melihat glimpse() untuk menelusuri kolom sebuah tibble di sisi R.

sparklyr memiliki fungsi bernama sdf_schema() untuk menelusuri kolom tibble di sisi R. Pemanggilannya mudah; namun nilai kembalian agak merepotkan untuk diolah.

sdf_schema(a_tibble)

Nilai kembalian adalah sebuah list, dan setiap elemennya merupakan list dengan dua elemen yang memuat nama dan tipe data tiap kolom. Latihan ini menampilkan sebuah transformasi data agar tipe data lebih mudah dilihat.

Berikut perbandingan bagaimana tipe data R dipetakan ke tipe data Spark. Tipe data lain saat ini belum didukung oleh sparklyr.

R type Spark type
logical BooleanType
numeric DoubleType
integer IntegerType
character StringType
list ArrayType

Latihan ini merupakan bagian dari kursus

Pengantar Spark dengan sparklyr di R

Lihat Kursus

Instruksi latihan

Sebuah koneksi Spark telah dibuat untuk Anda sebagai spark_conn. Sebuah tibble yang terhubung ke metadata track yang disimpan di Spark telah didefinisikan sebelumnya sebagai track_metadata_tbl.

  • Panggil sdf_schema() untuk mendapatkan skema metadata track.
  • Jalankan kode transformasi pada schema untuk melihatnya dalam format tibble yang lebih mudah dibaca.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

# Get the schema
(schema <- ___(___))

# Transform the schema
schema %>%
  lapply(function(x) do.call(data_frame, x)) %>%
  bind_rows()
Edit dan Jalankan Kode