Base RDD बनाएँ और उसे ट्रांसफॉर्म करें
असंरचित डेटा (log lines, images, binary files) की मात्रा तेज़ी से बढ़ रही है, और PySpark RDDs के ज़रिए ऐसे डेटा का विश्लेषण करने के लिए एक बेहतरीन फ़्रेमवर्क है। इस 3-भाग के अभ्यास में, आप ऐसा कोड लिखेंगे जो Complete Works of William Shakespeare से सबसे आम शब्दों की गणना करता है.
शब्द-गणना प्रोग्राम लिखने के संक्षिप्त चरण इस प्रकार हैं:
Complete_Shakespeare.txtफ़ाइल से एक base RDD बनाएँ.- RDD transformation का उपयोग करके base RDD के हर एलिमेंट से शब्दों की एक लंबी सूची बनाएँ.
- अपने डेटा से stop words हटाएँ.
- एक pair RDD बनाएँ जहाँ हर एलिमेंट
('w', 1)जैसा pair tuple हो. - pair RDD के एलिमेंट्स को key (शब्द) के आधार पर group करें और उनकी values को जोड़ें.
- keys (शब्द) और values (गिनती) को स्वैप करें ताकि key count हो और value शब्द.
- अंत में, RDD को descending क्रम में sort करें और सबसे ज़्यादा आने वाले 10 शब्द तथा उनकी आवृत्तियाँ प्रिंट करें.
इस पहले अभ्यास में, आप Complete_Shakespeare.txt फ़ाइल से एक base RDD बनाएँगे और उसे ट्रांसफॉर्म करके शब्दों की एक लंबी सूची तैयार करेंगे.
ध्यान रखें, आपके वर्कस्पेस में SparkContext sc पहले से उपलब्ध है। एक file_path वैरिएबल (जो Complete_Shakespeare.txt फ़ाइल का path है) भी आपके लिए लोड किया गया है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
PySpark के साथ Big Data Fundamentals
अभ्यास निर्देश
file_pathसे लाइन्स पढ़ने वालाbaseRDDनाम का एक RDD बनाएँ.baseRDDको ट्रांसफॉर्म करके शब्दों की एक लंबी सूची बनाएँ और एक नयाsplitRDDतैयार करें.splitRDDमें कुल शब्दों की संख्या गिनें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Create a baseRDD from the file path
baseRDD = sc.____(file_path)
# Split the lines of baseRDD into words
splitRDD = baseRDD.____(lambda x: x.split())
# Count the total number of words
print("Total number of words in splitRDD:", splitRDD.____())