SparkSession बनाना
इस अभ्यास में, आप सभी उपलब्ध कोर का उपयोग करते हुए एक लोकल Spark क्लस्टर शुरू करेंगे. क्लस्टर को एक SparkSession ऑब्जेक्ट के ज़रिए एक्सेस किया जाएगा.
SparkSession क्लास में एक builder एट्रिब्यूट होता है, जो Builder क्लास का इंस्टेंस है. Builder क्लास तीन महत्वपूर्ण मेथड्स उपलब्ध कराता है, जिनसे आप:
- मास्टर नोड का लोकेशन तय कर सकते हैं;
- एप्लिकेशन को नाम दे सकते हैं (वैकल्पिक); और
- मौजूदा
SparkSessionप्राप्त कर सकते हैं या, अगर कोई नहीं है, तो नया बना सकते हैं.
SparkSession क्लास का version एट्रिब्यूट Spark का वर्ज़न देता है. नोट: वर्ज़न को pyspark मॉड्यूल के __version__ एट्रिब्यूट से भी एक्सेस किया जा सकता है.
SparkSession के बारे में और जानें यहाँ.
जब आप क्लस्टर का काम पूरा कर लें, तो उसे शटडाउन करना अच्छा रहता है. इससे उसके संसाधन (resources) मुक्त हो जाते हैं और अन्य प्रोसेसेज़ के लिए उपलब्ध हो जाते हैं.
नोट्स:
- आपको IPython Shell के बगल में Slides पैनल में दी गई लेसन स्लाइड्स को दोबारा देखना उपयोगी लग सकता है.
- इस अभ्यास में Spark का वर्ज़न लेसन्स वाले वर्ज़न जैसा नहीं है. अभ्यास प्लेटफ़ॉर्म को Spark के अधिक हालिया वर्ज़न पर अपडेट किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Machine Learning
अभ्यास निर्देश
pyspark.sqlसेSparkSessionक्लास इम्पोर्ट करें.- एक
SparkSessionऑब्जेक्ट बनाइए जो लोकल क्लस्टर से कनेक्ट हो. सभी उपलब्ध कोर का उपयोग करें. एप्लिकेशन का नाम'test'रखें. - क्लस्टर पर चल रहे Spark का वर्ज़न पाने के लिए
SparkSessionऑब्जेक्ट केversionएट्रिब्यूट का उपयोग करें. नोट: वर्ज़न प्रेज़ेंटेशन में इस्तेमाल किए गए वर्ज़न से अलग हो सकता है (इसे समय-समय पर अपडेट किया जाता है). - क्लस्टर को शटडाउन करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Import the SparkSession class
from ____ import ____
# Create SparkSession object
spark = SparkSession.builder \
.master(____) \
.____(____) \
.____()
# What version of Spark?
print(spark.____)
# Terminate the cluster
spark.____()