Zacznij terazZacznij za darmo

Reprezentacja TF-IDF opinii o produktach

Pracujesz z zespołem obsługi klienta w firmie zajmującej się inteligentnymi urządzeniami domowymi. Zebrali oni opinie użytkowników na temat różnych produktów i chcą zidentyfikować słowa, które wyróżniają się w poszczególnych recenzjach. Proponujesz zastosowanie techniki TF-IDF, aby wyodrębnić najbardziej istotne terminy z każdej opinii. Pomóżmy im zacząć!

Funkcja preprocess(), która przyjmuje tekst i zwraca jego przetworzoną wersję, jest już wczytana. Funkcja ta stosuje zamianę liter na małe, tokenizację i usuwanie znaków interpunkcyjnych. Biblioteka Pandas została zaimportowana jako pd, a klasa TfidfVectorizer jest gotowa do użycia.

To ćwiczenie jest częścią kursu

Przetwarzanie języka naturalnego (NLP) w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Zainicjalizuj wektoryzator TF-IDF vectorizer.
  • Przekształć oczyszczone recenzje w macierz tfidf_matrix.
  • Utwórz DataFrame df dla macierzy tfidf_matrix, używając słów ze słownika jako nazw kolumn.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

reviews = ["The smart speaker is incredible. Clear sound and fast responses!",
           "I am disappointed with the smart bulb. It stopped working in a week.",
           "The thermostat is okay. Not too smart, but functional."]
cleaned_reviews = [preprocess(review) for review in reviews]

# Initialize the vectorizer
vectorizer = ____
# Transform the cleaned reviews
tfidf_matrix = ____
# Create a DataFrame for TF-IDF
df = pd.DataFrame(
  tfidf_matrix.toarray(),
  columns=vectorizer.____
)
print(df.head())
Edytuj i uruchom kod