Mulai sekarangMulai gratis

Menyalin data ke Spark

Sebelum dapat melakukan pekerjaan nyata menggunakan Spark, Anda perlu memasukkan data ke dalamnya. sparklyr memiliki beberapa fungsi seperti spark_read_csv() yang akan membaca file CSV ke Spark. Secara umum, akan sangat berguna jika Anda dapat menyalin data dari R ke Spark. Hal ini dilakukan dengan fungsi copy_to() milik dplyr. Harap diperhatikan: menyalin data pada dasarnya adalah proses yang lambat. Bahkan, banyak strategi pengoptimalan kinerja saat bekerja dengan himpunan data besar berfokus pada cara menghindari penyalinan data dari satu lokasi ke lokasi lain.

copy_to() menerima dua argumen: koneksi Spark (dest), dan data frame (df) yang akan disalin ke Spark.

Setelah Anda menyalin data ke Spark, Anda mungkin ingin memastikan bahwa prosesnya benar-benar berhasil. Anda dapat melihat daftar semua data frame yang tersimpan di Spark menggunakan src_tbls(), yang hanya memerlukan argumen koneksi Spark (x).

Sepanjang kursus, Anda akan mengeksplorasi metadata track dari Million Song Dataset. Meskipun Spark mampu diskalakan jauh melampaui satu juta baris data, untuk menjaga agar tetap sederhana dan responsif, Anda akan menggunakan subset seribu track. Untuk memperjelas istilah: sebuah track merujuk pada satu baris dalam himpunan data. Untuk himpunan data seribu track Anda, ini sama dengan sebuah lagu (meskipun himpunan data lengkap dengan satu juta baris memiliki beberapa lagu duplikat).

Latihan ini merupakan bagian dari kursus

Pengantar Spark dengan sparklyr di R

Lihat Kursus

Instruksi latihan

track_metadata, yang berisi nama lagu, nama artis, dan metadata lain untuk 1.000 track, telah didefinisikan sebelumnya di ruang kerja Anda.

  • Gunakan str() untuk menelusuri himpunan data track_metadata.
  • Sambungkan ke klaster Spark lokal Anda, dan simpan koneksinya dalam spark_conn.
  • Salin track_metadata ke klaster Spark menggunakan copy_to().
  • Lihat data frame apa saja yang tersedia di Spark menggunakan src_tbls().
  • Putuskan sambungan dari Spark.

Latihan interaktif langsung praktik

Cobalah latihan ini dengan melengkapi kode contoh ini.

# Load dplyr
___

# Explore track_metadata structure
___

# Connect to your Spark cluster
spark_conn <- spark_connect("___")

# Copy track_metadata to Spark
track_metadata_tbl <- ___(___, ___, overwrite = TRUE)

# List the data frames available in Spark
___(___)

# Disconnect from Spark
spark_disconnect(___)
Edit dan Jalankan Kode