कनेक्ट–वर्क–डिसकनेक्ट पैटर्न
जब आपका डेटा किसी डेटाबेस में होता है, तो sparklyr के साथ काम करना dplyr जैसा ही लगता है। वास्तव में, sparklyr आपके R कोड को Spark को भेजने से पहले SQL कोड में बदल देता है।
आम वर्कफ़्लो के तीन चरण होते हैं:
spark_connect()का उपयोग करके Spark से कनेक्ट करें।- कुछ काम करें।
spark_disconnect()का उपयोग करके Spark से कनेक्शन बंद करें।
इस अभ्यास में, आप सबसे सरल काम करेंगे: चल रहे Spark का वर्ज़न लौटाना, spark_version() का उपयोग करके।
spark_connect() ऐसा URL लेता है जो Spark का स्थान बताता है। लोकल क्लस्टर (जैसा आप चला रहे हैं) के लिए URL "local" होना चाहिए। रिमोट क्लस्टर (किसी दूसरी मशीन पर, आमतौर पर हाई-परफॉर्मेंस सर्वर) के लिए, कनेक्शन स्ट्रिंग एक URL और पोर्ट होता है जिस पर कनेक्ट करना है।
spark_version() और spark_disconnect() दोनों के लिए केवल एक आर्ग्युमेंट होता है: Spark कनेक्शन।
एक सावधानी. किसी क्लस्टर से कनेक्ट होने में कई सेकंड लगते हैं, इसलिए बार-बार कनेक्ट और डिसकनेक्ट करना व्यावहारिक नहीं है। आपको हर DataCamp अभ्यास के लिए दोबारा कनेक्ट करना पड़ता है, लेकिन जब आप अपने वर्कफ़्लो में sparklyr शामिल करते हैं, तो बेहतर रहता है कि जितने समय तक आप Spark के साथ काम करना चाहते हैं, उतने समय तक कनेक्शन खुला रखें।
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में sparklyr के साथ Spark परिचय
अभ्यास निर्देश
library()के साथsparklyrपैकेज लोड करें।spark_connect()कॉल करके Spark से कनेक्ट करें, आर्ग्युमेंटmaster = "local"के साथ। परिणामspark_connको असाइन करें।spark_version()का उपयोग करके Spark का वर्ज़न प्राप्त करें, आर्ग्युमेंटsc = spark_connके साथ।spark_disconnect()का उपयोग करके Spark से डिसकनेक्ट करें, आर्ग्युमेंटsc = spark_connके साथ।
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Load sparklyr
___
# Connect to your Spark cluster
spark_conn <- ___
# Print the version of Spark
___
# Disconnect from Spark
___