Menyalin data ke Spark
Sebelum dapat melakukan pekerjaan nyata menggunakan Spark, Anda perlu memasukkan data ke dalamnya. sparklyr memiliki beberapa fungsi seperti spark_read_csv() yang akan membaca file CSV ke Spark. Secara umum, akan sangat berguna jika Anda dapat menyalin data dari R ke Spark. Hal ini dilakukan dengan fungsi copy_to() milik dplyr. Harap diperhatikan: menyalin data pada dasarnya adalah proses yang lambat. Bahkan, banyak strategi pengoptimalan kinerja saat bekerja dengan himpunan data besar berfokus pada cara menghindari penyalinan data dari satu lokasi ke lokasi lain.
copy_to() menerima dua argumen: koneksi Spark (dest), dan data frame (df) yang akan disalin ke Spark.
Setelah Anda menyalin data ke Spark, Anda mungkin ingin memastikan bahwa prosesnya benar-benar berhasil. Anda dapat melihat daftar semua data frame yang tersimpan di Spark menggunakan src_tbls(), yang hanya memerlukan argumen koneksi Spark (x).
Sepanjang kursus, Anda akan mengeksplorasi metadata track dari Million Song Dataset. Meskipun Spark mampu diskalakan jauh melampaui satu juta baris data, untuk menjaga agar tetap sederhana dan responsif, Anda akan menggunakan subset seribu track. Untuk memperjelas istilah: sebuah track merujuk pada satu baris dalam himpunan data. Untuk himpunan data seribu track Anda, ini sama dengan sebuah lagu (meskipun himpunan data lengkap dengan satu juta baris memiliki beberapa lagu duplikat).
Latihan ini merupakan bagian dari kursus
Pengantar Spark dengan sparklyr di R
Instruksi latihan
track_metadata, yang berisi nama lagu, nama artis, dan metadata lain untuk 1.000 track, telah didefinisikan sebelumnya di ruang kerja Anda.
- Gunakan
str()untuk menelusuri himpunan datatrack_metadata. - Sambungkan ke klaster Spark lokal Anda, dan simpan koneksinya dalam
spark_conn. - Salin
track_metadatake klaster Spark menggunakancopy_to(). - Lihat data frame apa saja yang tersedia di Spark menggunakan
src_tbls(). - Putuskan sambungan dari Spark.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Load dplyr
___
# Explore track_metadata structure
___
# Connect to your Spark cluster
spark_conn <- spark_connect("___")
# Copy track_metadata to Spark
track_metadata_tbl <- ___(___, ___, overwrite = TRUE)
# List the data frames available in Spark
___(___)
# Disconnect from Spark
spark_disconnect(___)