BaşlayınÜcretsiz başlayın

Bağlan-çalış-bağlantıyı kes kalıbı

sparklyr ile çalışmak, verilerin bir veritabanında olduğu durumlarda dplyr ile çalışmaya çok benzer. Aslında sparklyr, R kodunu Spark'a iletmeden önce SQL koduna dönüştürür.

Tipik iş akışı üç adımdan oluşur:

  1. spark_connect() ile Spark'a bağlan.
  2. Biraz iş yap.
  3. spark_disconnect() ile Spark bağlantısını kapat.

Bu egzersizde, çalıştırılan Spark'ın sürümünü döndürmek gibi yapılabilecek en basit işi yapacaksın: spark_version() kullanarak.

spark_connect(), Spark'ın konumunu veren bir URL alır. Yerel bir küme (şu anda çalıştırdığın gibi) için URL "local" olmalıdır. Uzak bir küme (genellikle yüksek performanslı bir sunucu üzerinde, başka bir makinede) için bağlantı dizesi bağlanılacak bir URL ve port olacaktır.

Hem spark_version() hem de spark_disconnect() yalnızca Spark bağlantısını argüman olarak alır.

Küçük bir uyarı. Bir kümeye bağlanmak birkaç saniye sürer, bu yüzden düzenli olarak bağlanıp bağlantıyı kesmek pratik değildir. Her DataCamp egzersizi için yeniden bağlanman gerekse de, sparklyr'ı kendi iş akışına dahil ettiğinde, genellikle Spark ile çalışmak istediğin süre boyunca bağlantıyı açık tutmak en iyisidir.

Bu egzersiz, kursun bir parçasıdır

R ile sparklyr kullanarak Spark’a Giriş

Kursa Göz Atın

Egzersiz talimatları

  • library() ile sparklyr paketini yükle.
  • spark_connect() çağrısı ile, master = "local" argümanını kullanarak Spark'a bağlan. Sonucu spark_conn değişkenine ata.
  • spark_version() ile, sc = spark_conn argümanını kullanarak Spark sürümünü al.
  • spark_disconnect() ile, sc = spark_conn argümanını kullanarak Spark bağlantısını kes.

Uygulamalı etkileşimli egzersiz

Bu egzersizi bu örnek kodu tamamlayarak deneyin.

# Load sparklyr
___

# Connect to your Spark cluster
spark_conn <- ___

# Print the version of Spark
___

# Disconnect from Spark
___
Kodu Düzenle ve Çalıştır