कस्टमर रिव्यू से शब्दावली बनाना
आप TechZone, एक कंज्यूमर इलेक्ट्रॉनिक्स कंपनी, की प्रोडक्ट एनालिटिक्स टीम का हिस्सा हैं. आपको एक नए गैजेट के लिए कस्टमर रिव्यू का छोटा बैच मिला है. रिव्यू का विश्लेषण करने के लिए, आप पहले टेक्स्ट को प्रीप्रोसेस करेंगे और एक शब्दावली तैयार करेंगे — यूनिक शब्दों की सूची जो हर रिव्यू को न्यूमेरिकल डेटा के रूप में दर्शाने के लिए इस्तेमाल होने वाले फीचर तय करती है.
एक preprocess() फंक्शन आपके लिए प्रीलोडेड है. यह टेक्स्ट को lowercase करता है, उसे tokenize करता है, और punctuation हटा देता है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Natural Language Processing (NLP)
अभ्यास निर्देश
- डेटासेट में हर review को
preprocess()फंक्शन से प्रीप्रोसेस करें. - प्रीप्रोसेस किए गए रिव्यू पर
vectorizerको fit करें. - प्राप्त शब्दावली को प्रिंट करें.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
reviews = [
"The product is fantastic! It works like a charm.",
"I hated the product. It broke after one use.",
"Product was okay, not the best, but fine overall."
]
# Preprocess the reviews
cleaned_reviews = [____ for ____ in ____]
vectorizer = CountVectorizer()
# Fit the vectorizer
vectorizer.____
# Print the vocabulary
print(vectorizer.____)