शब्द आवृत्तियाँ प्रिंट करें
एक ही key (शब्द) वाली values (counts) को मिलाने के बाद, इस अभ्यास में आप पहले 10 शब्द-आवृत्तियाँ वापस करेंगे। आप collect() का उपयोग करके सारे elements एक साथ ला सकते थे, लेकिन यह अच्छा अभ्यास नहीं है और अनुशंसित नहीं है। RDDs बहुत बड़े हो सकते हैं: आपकी मेमोरी खत्म हो सकती है और आपका कंप्यूटर क्रैश हो सकता है.
अगर हम शीर्ष 10 शब्द वापस करना चाहें तो? इसके लिए, पहले आपको key (शब्द) और value (count) को बदलना होगा ताकि key count हो और value शब्द। अभी result_RDD में key element 0 है और value element 1 है। टपल में key और value बदलने के बाद, आप pair RDD को key (count) के आधार पर sort करेंगे। इस तरह key के आधार पर RDD को sort करना आसान होता है, बजाय PySpark में sortByKey ऑपरेशन का उपयोग करने के। अंत में, आप sorted RDD से उनकी आवृत्तियों के आधार पर शीर्ष 10 शब्द वापस करेंगे।
आपके workspace में SparkContext sc और resultRDD पहले से उपलब्ध हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Big Data Fundamentals
अभ्यास निर्देश
resultRDDRDD से पहले 10 शब्द और उनकी आवृत्तियाँ प्रिंट करें.resultRDDमें keys और values को आपस में बदलें.- keys को descending क्रम में sort करें.
- sorted RDD से सबसे अधिक बार आने वाले शीर्ष 10 शब्द और उनकी आवृत्तियाँ प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Display the first 10 words and their frequencies from the input RDD
for word in resultRDD.____(10):
print(word)
# Swap the keys and values from the input RDD
resultRDD_swap = resultRDD.____(lambda x: (x[1], x[____]))
# Sort the keys in descending order
resultRDD_swap_sort = resultRDD_swap.____(ascending=False)
# Show the top 10 most frequent words and their frequencies from the sorted RDD
for word in resultRDD_swap_sort.____(____):
print("{},{}". format(____, word[0]))