Bağlan-çalış-bağlantıyı kes kalıbı
sparklyr ile çalışmak, verilerin bir veritabanında olduğu durumlarda dplyr ile çalışmaya çok benzer. Aslında sparklyr, R kodunu Spark'a iletmeden önce SQL koduna dönüştürür.
Tipik iş akışı üç adımdan oluşur:
spark_connect()ile Spark'a bağlan.- Biraz iş yap.
spark_disconnect()ile Spark bağlantısını kapat.
Bu egzersizde, çalıştırılan Spark'ın sürümünü döndürmek gibi yapılabilecek en basit işi yapacaksın: spark_version() kullanarak.
spark_connect(), Spark'ın konumunu veren bir URL alır. Yerel bir küme (şu anda çalıştırdığın gibi) için URL "local" olmalıdır. Uzak bir küme (genellikle yüksek performanslı bir sunucu üzerinde, başka bir makinede) için bağlantı dizesi bağlanılacak bir URL ve port olacaktır.
Hem spark_version() hem de spark_disconnect() yalnızca Spark bağlantısını argüman olarak alır.
Küçük bir uyarı. Bir kümeye bağlanmak birkaç saniye sürer, bu yüzden düzenli olarak bağlanıp bağlantıyı kesmek pratik değildir. Her DataCamp egzersizi için yeniden bağlanman gerekse de, sparklyr'ı kendi iş akışına dahil ettiğinde, genellikle Spark ile çalışmak istediğin süre boyunca bağlantıyı açık tutmak en iyisidir.
Bu egzersiz, kursun bir parçasıdır
R ile sparklyr kullanarak Spark’a Giriş
Egzersiz talimatları
library()ilesparklyrpaketini yükle.spark_connect()çağrısı ile,master = "local"argümanını kullanarak Spark'a bağlan. Sonucuspark_conndeğişkenine ata.spark_version()ile,sc = spark_connargümanını kullanarak Spark sürümünü al.spark_disconnect()ile,sc = spark_connargümanını kullanarak Spark bağlantısını kes.
Uygulamalı etkileşimli egzersiz
Bu egzersizi bu örnek kodu tamamlayarak deneyin.
# Load sparklyr
___
# Connect to your Spark cluster
spark_conn <- ___
# Print the version of Spark
___
# Disconnect from Spark
___