प्रोडक्ट फीडबैक का TF-IDF रिप्रेज़ेंटेशन
आप एक स्मार्ट होम कंपनी की कस्टमर सपोर्ट टीम के साथ काम कर रहे हैं. उन्होंने अलग-अलग स्मार्ट डिवाइसेज़ पर यूज़र फीडबैक जमा किया है और जानना चाहते हैं कि हर रिव्यू में कौन-से शब्द सबसे अलग उभरते हैं. आप TF-IDF तकनीक इस्तेमाल करने का सुझाव देते हैं ताकि हर फीडबैक एंट्री में सबसे प्रासंगिक शब्द हाइलाइट हो सकें. आइए, उन्हें शुरुआत करने में मदद करें!
एक preprocess() फंक्शन प्री-लोडेड है जो टेक्स्ट लेता है और प्रोसेस्ड टेक्स्ट लौटाता है. यह फंक्शन लोअरकेसिंग, टोकनाइज़ेशन, और पंक्चुएशन हटाने का काम करता है. Pandas को pd के रूप में इम्पोर्ट किया गया है, और TfidfVectorizer क्लास उपयोग के लिए तैयार है.
यह अभ्यास पाठ्यक्रम का हिस्सा है
Python में Natural Language Processing (NLP)
अभ्यास निर्देश
- एक TF-IDF
vectorizerइनिशियलाइज़ करें. - क्लीन किए गए रिव्यूज़ को
tfidf_matrixमें ट्रांसफॉर्म करें. tfidf_matrixके लिए एक DataFramedfबनाएँ, जिसमें कॉलम के रूप में शब्दावली (vocabulary) शब्द हों.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
reviews = ["The smart speaker is incredible. Clear sound and fast responses!",
"I am disappointed with the smart bulb. It stopped working in a week.",
"The thermostat is okay. Not too smart, but functional."]
cleaned_reviews = [preprocess(review) for review in reviews]
# Initialize the vectorizer
vectorizer = ____
# Transform the cleaned reviews
tfidf_matrix = ____
# Create a DataFrame for TF-IDF
df = pd.DataFrame(
tfidf_matrix.toarray(),
columns=vectorizer.____
)
print(df.head())