ÎncepețiÎncepe gratuit

Reprezentarea TF-IDF a feedback-ului despre produse

Lucrezi alături de echipa de suport a unei companii de dispozitive smart home. Aceasta a colectat feedback de la utilizatori despre o gamă de dispozitive inteligente și dorește să identifice cuvintele care ies în evidență în fiecare recenzie. Propui utilizarea tehnicii TF-IDF pentru a evidenția cei mai relevanți termeni din fiecare recenzie. Să îi ajutăm să înceapă!

O funcție preprocess() care primește un text și returnează unul procesat este deja încărcată pentru tine. Aceasta aplică transformarea în litere mici, tokenizarea și eliminarea semnelor de punctuație. Pandas a fost importat ca pd, iar clasa TfidfVectorizer este gata de utilizare.

Acest exercițiu face parte din cursul

Procesarea Limbajului Natural (NLP) în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Inițializează un vectorizer TF-IDF.
  • Transformă recenziile procesate într-o tfidf_matrix.
  • Creează un DataFrame df pentru tfidf_matrix, folosind cuvintele din vocabular drept coloane.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

reviews = ["The smart speaker is incredible. Clear sound and fast responses!",
           "I am disappointed with the smart bulb. It stopped working in a week.",
           "The thermostat is okay. Not too smart, but functional."]
cleaned_reviews = [preprocess(review) for review in reviews]

# Initialize the vectorizer
vectorizer = ____
# Transform the cleaned reviews
tfidf_matrix = ____
# Create a DataFrame for TF-IDF
df = pd.DataFrame(
  tfidf_matrix.toarray(),
  columns=vectorizer.____
)
print(df.head())
Editează și rulează codul