Python में Spark का उपयोग
Spark का उपयोग करने का पहला कदम है किसी क्लस्टर से कनेक्ट करना.
व्यवहार में, क्लस्टर एक रिमोट मशीन पर होस्ट किया जाता है जो बाकी सभी नोड्स से कनेक्ट रहती है. एक कंप्यूटर होता है जिसे master कहा जाता है. यह डेटा और कम्प्यूटेशंस को बाँटने का काम मैनेज करता है. master क्लस्टर के बाकी कंप्यूटरों से जुड़ा रहता है, जिन्हें worker कहा जाता है. master, workers को डेटा और कैल्क्युलेशंस चलाने के लिए भेजता है, और वे अपने परिणाम वापस master को भेजते हैं.
जब आप Spark शुरू कर रहे होते हैं, तो लोकली क्लस्टर चलाना आसान रहता है. इसलिए, इस कोर्स में, किसी दूसरी मशीन से कनेक्ट करने के बजाय, सारी कम्प्यूटेशंस DataCamp के सर्वर्स पर एक simulated क्लस्टर में चलेंगी.
कनेक्शन बनाना उतना ही सरल है जितना कि SparkContext क्लास का एक इंस्टेंस बनाना. इस क्लास के कन्स्ट्रक्टर में कुछ वैकल्पिक आर्ग्युमेंट्स होते हैं जिनसे आप उस क्लस्टर की विशेषताएँ बता सकते हैं जिससे आप कनेक्ट हो रहे हैं.
इन सभी विशेषताओं को रखने वाला ऑब्जेक्ट SparkConf() कन्स्ट्रक्टर से बनाया जा सकता है. पूरी जानकारी के लिए documentation देखिए!
इस कोर्स के बाकी हिस्से में आपके workspace में sc नाम का SparkContext पहले से उपलब्ध रहेगा.
PySpark से आप Spark क्लस्टर से कैसे कनेक्ट करते हैं?
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark की नींव
इंटरैक्टिव व्यावहारिक अभ्यास
हमारे इंटरैक्टिव अभ्यासों में से किसी एक के साथ सिद्धांत को व्यवहार में बदलें
अभ्यास शुरू करें