Stemming
अब जब आपने review टेक्स्ट को साफ कर लिया है और stop words व punctuation हटा दिए हैं, तो आप बचे हुए शब्दों को उनकी मूल जड़ तक लाने के लिए stemming से normalize करने के लिए तैयार हैं. इससे मिलते-जुलते शब्द एक साथ समूहित होते हैं, और आपका विश्लेषण अधिक सुसंगत और कुशल हो जाता है.
PorterStemmer क्लास उपलब्ध कराई गई है, साथ ही clean_tokens की एक सूची भी दी गई है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Natural Language Processing (NLP)
अभ्यास निर्देश
PorterStemmer()को इनिशियलाइज़ करें.- एक list comprehension का उपयोग करके
clean_tokensसूची के प्रत्येक टोकन पर stemming लागू करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
clean_tokens = ['flying', 'lot', 'lately', 'flights', 'keep', 'getting', 'delayed', 'honestly', 'traveling', 'work', 'gets', 'exhausting', 'endless', 'delays', 'every', 'travel', 'teaches', 'something', 'new']
# Create stemmer
stemmer = ____()
# Stem each token
stemmed_tokens = [____.____(____) for ____ in clean_tokens]
print(stemmed_tokens)