Reprezentarea TF-IDF a feedback-ului despre produse
Lucrezi alături de echipa de suport a unei companii de dispozitive smart home. Aceasta a colectat feedback de la utilizatori despre o gamă de dispozitive inteligente și dorește să identifice cuvintele care ies în evidență în fiecare recenzie. Propui utilizarea tehnicii TF-IDF pentru a evidenția cei mai relevanți termeni din fiecare recenzie. Să îi ajutăm să înceapă!
O funcție preprocess() care primește un text și returnează unul procesat este deja încărcată pentru tine. Aceasta aplică transformarea în litere mici, tokenizarea și eliminarea semnelor de punctuație. Pandas a fost importat ca pd, iar clasa TfidfVectorizer este gata de utilizare.
Acest exercițiu face parte din cursul
Procesarea Limbajului Natural (NLP) în Python
Instrucțiuni pentru exercițiu
- Inițializează un
vectorizerTF-IDF. - Transformă recenziile procesate într-o
tfidf_matrix. - Creează un DataFrame
dfpentrutfidf_matrix, folosind cuvintele din vocabular drept coloane.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
reviews = ["The smart speaker is incredible. Clear sound and fast responses!",
"I am disappointed with the smart bulb. It stopped working in a week.",
"The thermostat is okay. Not too smart, but functional."]
cleaned_reviews = [preprocess(review) for review in reviews]
# Initialize the vectorizer
vectorizer = ____
# Transform the cleaned reviews
tfidf_matrix = ____
# Create a DataFrame for TF-IDF
df = pd.DataFrame(
tfidf_matrix.toarray(),
columns=vectorizer.____
)
print(df.head())