Mulai sekarangMulai gratis

Mengumpulkan data kembali dari Spark

Dalam latihan 'Exploring the structure of tibbles' di Bab 1, Anda melihat bahwa tibble tidak menyimpan salinan data. Sebagai gantinya, data tetap berada di Spark, dan tibble hanya menyimpan detail tentang apa yang ingin diambilnya dari Spark.

Ada banyak alasan mengapa Anda mungkin ingin memindahkan data dari Spark ke R. Anda sudah melihat bagaimana sebagian data dipindahkan dari Spark ke R saat Anda mencetaknya. Anda juga perlu mengumpulkan himpunan data jika ingin membuat plot, atau jika ingin menggunakan teknik pemodelan yang tidak tersedia di Spark. (Bagaimanapun, R memiliki pilihan model terluas dibandingkan bahasa pemrograman lainnya.)

Untuk mengumpulkan data Anda—yaitu memindahkannya dari Spark ke R—Anda memanggil collect().

Latihan ini merupakan bagian dari kursus

Pengantar Spark dengan sparklyr di R

Lihat Kursus

Instruksi latihan

Sambungan Spark telah dibuat untuk Anda sebagai spark_conn. Sebuah tibble yang terhubung ke metadata trek yang disimpan di Spark telah didefinisikan sebelumnya sebagai track_metadata_tbl.

  • Saring baris track_metadata_tbl dengan artist_familiarity lebih besar dari 0,9, lalu simpan hasilnya ke results.
  • Cetak kelas dari results, perhatikan bahwa kelasnya adalah tbl_lazy (digunakan untuk data jarak jauh).
  • Kumpulkan hasil Anda, lalu simpan ke collected.
  • Cetak kelas dari collected, perhatikan bahwa kelasnya adalah tbl_df (digunakan untuk data lokal).

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# track_metadata_tbl has been pre-defined
track_metadata_tbl

results <- track_metadata_tbl %>%
  # Filter where artist familiarity is greater than 0.9
  ___

# Examine the class of the results
___

# Collect your results
collected <- results %>%
  ___

# Examine the class of the collected results
___
Edit dan Jalankan Kode