शुरू करेंमुफ़्त में शुरू करें

लोअरकेसिंग

आप एक ट्रैवल वेबसाइट के लिए यूज़र रिव्यूज़ का विश्लेषण कर रहे हैं. इन रिव्यूज़ में अक्सर "TRAVEL" और "travel" जैसी असंगत कैपिटलाइज़ेशन होती है. सेंटिमेंट एनालिसिस और टॉपिक एक्सट्रैक्शन के लिए टेक्स्ट तैयार करने के लिए, आप पहले सभी शब्दों को लोअरकेस में बदलेंगे, फिर उन्हें टोकनाइज़ करेंगे और स्टॉप वर्ड्स व पंक्चुएशन हटाएँगे.

word_tokenize() फंक्शन और stop_words लिस्ट दी गई है. NLTK के रिसोर्स पहले से डाउनलोड हैं.

यह अभ्यास पाठ्यक्रम का हिस्सा है

Python में Natural Language Processing (NLP)

पाठ्यक्रम देखें

अभ्यास निर्देश

  • दिए गए review को लोअरकेस में बदलें.
  • lower_text को शब्दों में टोकनाइज़ करें.
  • लिस्ट कॉम्प्रिहेंशन का उपयोग करके stop_words और string.punctuation लिस्ट की मदद से स्टॉप वर्ड्स और पंक्चुएशन हटाएँ.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

review = "I have been FLYING a lot lately and the Flights just keep getting DELAYED. Honestly, traveling for WORK gets exhausting with endless delays, but every trip teaches you something new!"

# Lowercase the review
lower_text = ____

# Tokenize the lower_text into words
tokens = ____

# Remove stop words and punctuation
clean_tokens = [____ if word ____ and word ____]

print(clean_tokens)
कोड संपादित करें और चलाएँ