Stop words हटाना
आप एक प्रोजेक्ट पर काम कर रहे हैं जहाँ लक्ष्य है यूज़र के फ़ीडबैक को अलग-अलग कैटेगरी जैसे "product issues", "service issues" और "suggestions" में क्लासिफ़ाई करना. अक्सर, stop words श्रेणियों के बीच फर्क बताने में ज़्यादा अर्थपूर्ण नहीं होते. आपका काम है इन stop words को हटाना, ताकि आप उन महत्वपूर्ण शब्दों पर ध्यान दे सकें जो आगे चलकर मशीन को फ़ीडबैक को सही टॉपिक्स में वर्गीकृत करने में मदद करेंगे.
nltk.tokenize से word_tokenize और nltk.corpus से stopwords.words फंक्शन आपके लिए इम्पोर्ट कर दिए गए हैं. इसके अलावा, NLTK के punkt_tab और stopwords रिसोर्स पहले से डाउनलोड किए जा चुके हैं.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Natural Language Processing (NLP)
अभ्यास निर्देश
- दिए गए फ़ीडबैक को शब्दों में tokenize करें.
- अंग्रेज़ी stopwords की सूची प्राप्त करें.
- अंग्रेज़ी stop words हटाएँ और परिणाम
filtered_tokensमें सेव करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
feedback = "I reached out to support and got a helpful response within minutes!!! Very #impressed"
# Tokenize the text
tokens = word_tokenize(____)
# Get the list of English stop words
stop_words = stopwords.____('____')
# Remove stop words
filtered_tokens = [____ for word in tokens if ____.lower() not in ____]
print(filtered_tokens)