Reprezentacja TF-IDF opinii o produktach
Pracujesz z zespołem obsługi klienta w firmie zajmującej się inteligentnymi urządzeniami domowymi. Zebrali oni opinie użytkowników na temat różnych produktów i chcą zidentyfikować słowa, które wyróżniają się w poszczególnych recenzjach. Proponujesz zastosowanie techniki TF-IDF, aby wyodrębnić najbardziej istotne terminy z każdej opinii. Pomóżmy im zacząć!
Funkcja preprocess(), która przyjmuje tekst i zwraca jego przetworzoną wersję, jest już wczytana. Funkcja ta stosuje zamianę liter na małe, tokenizację i usuwanie znaków interpunkcyjnych. Biblioteka Pandas została zaimportowana jako pd, a klasa TfidfVectorizer jest gotowa do użycia.
To ćwiczenie jest częścią kursu
Przetwarzanie języka naturalnego (NLP) w Pythonie
Instrukcje do ćwiczenia
- Zainicjalizuj wektoryzator TF-IDF
vectorizer. - Przekształć oczyszczone recenzje w macierz
tfidf_matrix. - Utwórz DataFrame
dfdla macierzytfidf_matrix, używając słów ze słownika jako nazw kolumn.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
reviews = ["The smart speaker is incredible. Clear sound and fast responses!",
"I am disappointed with the smart bulb. It stopped working in a week.",
"The thermostat is okay. Not too smart, but functional."]
cleaned_reviews = [preprocess(review) for review in reviews]
# Initialize the vectorizer
vectorizer = ____
# Transform the cleaned reviews
tfidf_matrix = ____
# Create a DataFrame for TF-IDF
df = pd.DataFrame(
tfidf_matrix.toarray(),
columns=vectorizer.____
)
print(df.head())