Mulai sekarangMulai gratis

Big data, tibble mungil

Pada latihan sebelumnya, ketika Anda menyalin data ke Spark, copy_to() mengembalikan sebuah nilai. Nilai yang dikembalikan ini adalah jenis khusus dari tibble() yang tidak berisi data apa pun miliknya sendiri. Untuk menjelaskannya, Anda perlu memahami sedikit tentang cara paket tidyverse menyimpan data. Tibble biasanya hanyalah varian data.frame yang memiliki metode cetak yang lebih baik. Namun, dplyr juga memungkinkan tibble menyimpan data dari sumber data jarak jauh, seperti basis data, dan—seperti dalam kasus ini—Spark. Untuk himpunan data jarak jauh, objek tibble hanya menyimpan koneksi ke data tersebut. Ini akan dibahas lebih lanjut nanti, tetapi poin penting saat ini adalah meskipun himpunan data Anda besar, ukuran objek tibble tetap kecil.

Di sisi Spark, data disimpan dalam variabel yang disebut DataFrame. Ini kurang lebih setara langsung dengan tipe variabel data.frame di R. (Walau tipe variabel kolom dinamai sedikit berbeda—misalnya kolom numeric disebut kolom DoubleType.) Sepanjang kursus, istilah data frame akan digunakan, kecuali diperlukan penjelasan antara data.frame dan DataFrame. Karena tipe ini juga analog dengan tabel basis data, terkadang istilah tabel juga akan digunakan untuk menggambarkan data berbentuk persegi panjang semacam ini.

Memanggil tbl() dengan koneksi Spark dan sebuah string yang menamai data frame Spark akan mengembalikan objek tibble yang sama seperti saat Anda menggunakan copy_to().

Salah satu alat berguna yang akan Anda lihat dalam latihan ini adalah fungsi object_size() dari paket pryr. Fungsi ini menunjukkan berapa banyak memori yang digunakan sebuah objek.

Latihan ini merupakan bagian dari kursus

Pengantar Spark dengan sparklyr di R

Lihat Kursus

Instruksi latihan

Koneksi Spark telah dibuat untuk Anda sebagai spark_conn. Metadata lagu untuk 1.000 trek disimpan di klaster Spark dalam tabel "track_metadata".

  • Tautkan ke tabel "track_metadata" menggunakan tbl(). Tugaskan hasilnya ke track_metadata_tbl.
  • Lihat seberapa besar himpunan datanya, dengan menggunakan dim() pada track_metadata_tbl.
  • Lihat seberapa kecil tibble-nya, dengan menggunakan object_size() pada track_metadata_tbl.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Link to the track_metadata table in Spark
track_metadata_tbl <- ___(___, "___")

# See how big the dataset is
___(___)

# See how small the tibble is
___(___)
Edit dan Jalankan Kode