शुरू करेंमुफ़्त में शुरू करें

स्टॉप वर्ड्स हटाएँ और डेटासेट को रिड्यूस करें

इस अभ्यास में आप अपने डेटा से स्टॉप वर्ड्स हटाएँगे. स्टॉप वर्ड्स वे सामान्य शब्द होते हैं जो अक्सर विश्लेषण में कम उपयोगी होते हैं, जैसे "I", "the", "a" आदि. आप अपनी बनाई हुई सूची से कई स्पष्ट स्टॉप वर्ड्स हटा सकते हैं. लेकिन इस अभ्यास में, आप केवल अपने वातावरण में दी गई क्यूरेटेड सूची stop_words से स्टॉप वर्ड्स हटाएँगे.

स्टॉप वर्ड्स हटाने के बाद, आप एक pair RDD बनाएँगे जहाँ हर एलिमेंट एक पेयर ट्यूपल (k, v) होगा जिसमें k key और v value है. इस उदाहरण में, pair RDD (w, 1) से बना है, जहाँ w RDD के हर शब्द के लिए है और 1 एक संख्या है. अंत में, आप pair RDD में समान key के लिए values को मिलाकर हर शब्द के occurrences की गिनती करेंगे.

ध्यान रखें कि आपके वर्कस्पेस में SparkContext sc और splitRDD पहले से उपलब्ध हैं, साथ ही stop_words सूची वैरिएबल भी.

यह अभ्यास पाठ्यक्रम का हिस्सा है

PySpark के साथ Big Data Fundamentals

पाठ्यक्रम देखें

अभ्यास निर्देश

  • splitRDD को फ़िल्टर करें और stop_words वैरिएबल में सूचीबद्ध स्टॉप वर्ड्स को हटा दें.
  • प्रत्येक शब्द एलिमेंट से ( w इटरेटर का उपयोग करके) शब्द और संख्या 1 वाला pair RDD ट्यूपल बनाएँ.
  • pair RDD में हर शब्द के occurrences (word frequency) की गिनती प्राप्त करें. ऐसा ट्रांसफॉर्मेशन उपयोग करें जो key, value (k,v) पेयर्स पर काम करता है. सोच-समझकर तय करें कि यहाँ कौन-सा फंक्शन उपयोग करना है.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Filter splitRDD to remove stop words from the stop_words curated list
splitRDD_no_stop = splitRDD.____(lambda x: x.lower() not in ____)

# Create a tuple of the word (w) and 1 
splitRDD_no_stop_words = splitRDD_no_stop.map(lambda w: (____, ____))

# Count of the number of occurences of each word
resultRDD = splitRDD_no_stop_words.____(lambda x, y: x + y)
कोड संपादित करें और चलाएँ