शुरू करेंमुफ़्त में शुरू करें

कनेक्ट–वर्क–डिसकनेक्ट पैटर्न

जब आपका डेटा किसी डेटाबेस में होता है, तो sparklyr के साथ काम करना dplyr जैसा ही लगता है। वास्तव में, sparklyr आपके R कोड को Spark को भेजने से पहले SQL कोड में बदल देता है।

आम वर्कफ़्लो के तीन चरण होते हैं:

  1. spark_connect() का उपयोग करके Spark से कनेक्ट करें।
  2. कुछ काम करें।
  3. spark_disconnect() का उपयोग करके Spark से कनेक्शन बंद करें।

इस अभ्यास में, आप सबसे सरल काम करेंगे: चल रहे Spark का वर्ज़न लौटाना, spark_version() का उपयोग करके।

spark_connect() ऐसा URL लेता है जो Spark का स्थान बताता है। लोकल क्लस्टर (जैसा आप चला रहे हैं) के लिए URL "local" होना चाहिए। रिमोट क्लस्टर (किसी दूसरी मशीन पर, आमतौर पर हाई-परफॉर्मेंस सर्वर) के लिए, कनेक्शन स्ट्रिंग एक URL और पोर्ट होता है जिस पर कनेक्ट करना है।

spark_version() और spark_disconnect() दोनों के लिए केवल एक आर्ग्युमेंट होता है: Spark कनेक्शन।

एक सावधानी. किसी क्लस्टर से कनेक्ट होने में कई सेकंड लगते हैं, इसलिए बार-बार कनेक्ट और डिसकनेक्ट करना व्यावहारिक नहीं है। आपको हर DataCamp अभ्यास के लिए दोबारा कनेक्ट करना पड़ता है, लेकिन जब आप अपने वर्कफ़्लो में sparklyr शामिल करते हैं, तो बेहतर रहता है कि जितने समय तक आप Spark के साथ काम करना चाहते हैं, उतने समय तक कनेक्शन खुला रखें।

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में sparklyr के साथ Spark परिचय

पाठ्यक्रम देखें

अभ्यास निर्देश

  • library() के साथ sparklyr पैकेज लोड करें।
  • spark_connect() कॉल करके Spark से कनेक्ट करें, आर्ग्युमेंट master = "local" के साथ। परिणाम spark_conn को असाइन करें।
  • spark_version() का उपयोग करके Spark का वर्ज़न प्राप्त करें, आर्ग्युमेंट sc = spark_conn के साथ।
  • spark_disconnect() का उपयोग करके Spark से डिसकनेक्ट करें, आर्ग्युमेंट sc = spark_conn के साथ।

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Load sparklyr
___

# Connect to your Spark cluster
spark_conn <- ___

# Print the version of Spark
___

# Disconnect from Spark
___
कोड संपादित करें और चलाएँ