Mengumpulkan data kembali dari Spark
Dalam latihan 'Exploring the structure of tibbles' di Bab 1, Anda melihat bahwa tibble tidak menyimpan salinan data. Sebagai gantinya, data tetap berada di Spark, dan tibble hanya menyimpan detail tentang apa yang ingin diambilnya dari Spark.
Ada banyak alasan mengapa Anda mungkin ingin memindahkan data dari Spark ke R. Anda sudah melihat bagaimana sebagian data dipindahkan dari Spark ke R saat Anda mencetaknya. Anda juga perlu mengumpulkan himpunan data jika ingin membuat plot, atau jika ingin menggunakan teknik pemodelan yang tidak tersedia di Spark. (Bagaimanapun, R memiliki pilihan model terluas dibandingkan bahasa pemrograman lainnya.)
Untuk mengumpulkan data Anda—yaitu memindahkannya dari Spark ke R—Anda memanggil collect().
Latihan ini merupakan bagian dari kursus
Pengantar Spark dengan sparklyr di R
Instruksi latihan
Sambungan Spark telah dibuat untuk Anda sebagai spark_conn. Sebuah tibble yang terhubung ke metadata trek yang disimpan di Spark telah didefinisikan sebelumnya sebagai track_metadata_tbl.
- Saring baris
track_metadata_tbldenganartist_familiaritylebih besar dari 0,9, lalu simpan hasilnya keresults. - Cetak kelas dari
results, perhatikan bahwa kelasnya adalahtbl_lazy(digunakan untuk data jarak jauh). - Kumpulkan hasil Anda, lalu simpan ke
collected. - Cetak kelas dari
collected, perhatikan bahwa kelasnya adalahtbl_df(digunakan untuk data lokal).
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# track_metadata_tbl has been pre-defined
track_metadata_tbl
results <- track_metadata_tbl %>%
# Filter where artist familiarity is greater than 0.9
___
# Examine the class of the results
___
# Collect your results
collected <- results %>%
___
# Examine the class of the collected results
___