ReduceByKey और Collect
सबसे लोकप्रिय pair RDD transformations में से एक reduceByKey() है, जो key, value (k,v) पेयर्स पर काम करता है और हर key के लिए values को मर्ज करता है। इस अभ्यास में, आप पहले tuples की एक लिस्ट से pair RDD बनाएँगे, फिर समान key वाली values को जोड़ेंगे और अंत में परिणाम को प्रिंट करेंगे।
ध्यान रखें, आपके वर्कस्पेस में SparkContext sc पहले से उपलब्ध है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Big Data Fundamentals
अभ्यास निर्देश
Rddनाम का एक pair RDD बनाएँ, जिसमें tuples(1,2),(3,4),(3,6),(4,5)हों.- समान key की values को जोड़ते हुए
reduceByKey()सेRddको ट्रांसफॉर्म करके pair RDDRdd_Reducedबनाएँ. - pair RDD
Rdd_Reducedकी सामग्री को collect करें और आउटपुट प्रिंट करने के लिए उन पर इटरेट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create PairRDD Rdd with key value pairs
Rdd = sc.parallelize([____])
# Apply reduceByKey() operation on Rdd
Rdd_Reduced = Rdd.reduceByKey(lambda x, y: ____)
# Iterate over the result and print the output
for num in Rdd_Reduced.____:
print("Key {} has {} Counts".format(____, num[1]))