Pola connect-work-disconnect
Bekerja dengan sparklyr sangat mirip dengan bekerja dengan dplyr saat Anda memiliki data di dalam basis data. Faktanya, sparklyr mengonversi kode R Anda menjadi kode SQL sebelum meneruskannya ke Spark.
Alur kerja umum memiliki tiga langkah:
- Sambungkan ke Spark menggunakan
spark_connect(). - Lakukan beberapa pekerjaan.
- Tutup koneksi ke Spark menggunakan
spark_disconnect().
Dalam latihan ini, Anda akan melakukan pekerjaan paling sederhana: mengembalikan versi Spark yang sedang berjalan, menggunakan spark_version().
spark_connect() menerima URL yang menunjukkan lokasi Spark. Untuk kluster lokal (seperti yang Anda jalankan), URL harus "local". Untuk kluster jarak jauh (di mesin lain, biasanya server berkinerja tinggi), string koneksi akan berupa URL dan port untuk dihubungkan.
spark_version() dan spark_disconnect() keduanya menerima objek koneksi Spark sebagai satu-satunya argumen.
Satu catatan peringatan. Menyambungkan ke kluster memerlukan beberapa detik, sehingga tidak praktis untuk sering menyambung dan memutus. Meskipun Anda perlu menyambung ulang untuk setiap latihan DataCamp, saat Anda mengintegrasikan sparklyr ke dalam alur kerja Anda sendiri, biasanya yang terbaik adalah membiarkan koneksi tetap terbuka selama Anda ingin bekerja dengan Spark.
Latihan ini merupakan bagian dari kursus
Pengantar Spark dengan sparklyr di R
Instruksi latihan
- Muat paket
sparklyrdenganlibrary(). - Sambungkan ke Spark dengan memanggil
spark_connect(), dengan argumenmaster = "local". Simpan hasilnya kespark_conn. - Dapatkan versi Spark menggunakan
spark_version(), dengan argumensc = spark_conn. - Putuskan koneksi dari Spark menggunakan
spark_disconnect(), dengan argumensc = spark_conn.
Latihan interaktif langsung praktik
Cobalah latihan ini dengan melengkapi kode contoh ini.
# Load sparklyr
___
# Connect to your Spark cluster
spark_conn <- ___
# Print the version of Spark
___
# Disconnect from Spark
___