शुरू करेंमुफ़्त में शुरू करें

ReduceByKey और Collect

सबसे लोकप्रिय pair RDD transformations में से एक reduceByKey() है, जो key, value (k,v) पेयर्स पर काम करता है और हर key के लिए values को मर्ज करता है। इस अभ्यास में, आप पहले tuples की एक लिस्ट से pair RDD बनाएँगे, फिर समान key वाली values को जोड़ेंगे और अंत में परिणाम को प्रिंट करेंगे।

ध्यान रखें, आपके वर्कस्पेस में SparkContext sc पहले से उपलब्ध है.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Big Data Fundamentals

पाठ्यक्रम देखें

अभ्यास निर्देश

  • Rdd नाम का एक pair RDD बनाएँ, जिसमें tuples (1,2),(3,4),(3,6),(4,5) हों.
  • समान key की values को जोड़ते हुए reduceByKey() से Rdd को ट्रांसफॉर्म करके pair RDD Rdd_Reduced बनाएँ.
  • pair RDD Rdd_Reduced की सामग्री को collect करें और आउटपुट प्रिंट करने के लिए उन पर इटरेट करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Create PairRDD Rdd with key value pairs
Rdd = sc.parallelize([____])

# Apply reduceByKey() operation on Rdd
Rdd_Reduced = Rdd.reduceByKey(lambda x, y: ____)

# Iterate over the result and print the output
for num in Rdd_Reduced.____: 
  print("Key {} has {} Counts".format(____, num[1]))
कोड संपादित करें और चलाएँ