Spark कॉन्फ़िगरेशन लिखना
अब जब आपने अपने क्लस्टर पर कुछ Spark कॉन्फ़िगरेशन की समीक्षा कर ली है, तो आप अपनी ज़रूरत के अनुसार Spark को ट्यून करने के लिए कुछ सेटिंग्स बदलना चाहते हैं. आप कुछ डेटा इम्पोर्ट करेंगे ताकि यह जाँच सकें कि आपके बदलावों का क्लस्टर पर प्रभाव पड़ा है.
शुरुआत में spark कॉन्फ़िगरेशन 200 पार्टिशन के डिफ़ॉल्ट मान पर सेट है.
spark ऑब्जेक्ट उपयोग के लिए उपलब्ध है. departures.txt.gz नाम की फ़ाइल इम्पोर्ट के लिए उपलब्ध है. departures.txt.gz से डिस्टिंक्ट पंक्तियों वाला एक शुरुआती DataFrame departures_df के रूप में उपलब्ध है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ डेटा क्लीनिंग
अभ्यास निर्देश
departures_dfमें पार्टिशन की संख्या कोbeforeवैरिएबल में स्टोर करें.spark.sql.shuffle.partitionsकॉन्फ़िगरेशन को 500 पार्टिशन में बदलें.- departures फ़ाइल से डिस्टिंक्ट पंक्तियाँ पढ़कर
departures_dfDataFrame को फिर से बनाएँ. - कॉन्फ़िगरेशन बदलने से पहले और बाद के पार्टिशन की संख्या प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Store the number of partitions in variable
before = departures_df.____
# Configure Spark to use 500 partitions
____('spark.sql.shuffle.partitions', ____)
# Recreate the DataFrame using the departures data file
departures_df = spark.read.csv('departures.txt.gz').____
# Print the number of partitions for each instance
print("Partition count before change: %d" % ____)
print("Partition count after change: %d" % ____)