Začněte nyníZačněte zdarma

TF-IDF reprezentace zpětné vazby k produktům

Pracuješ s týmem zákaznické podpory ve firmě vyrábějící chytré domácí spotřebiče. Tým shromáždil zpětnou vazbu uživatelů k různým chytrým zařízením a chce zjistit, která slova v jednotlivých recenzích nejvíce vynikají. Navrhuješ použít techniku TF-IDF, která pomůže identifikovat nejrelevantnější výrazy napříč všemi záznamy. Pojďme jim s tím pomoct!

Funkce preprocess(), která přijme text a vrátí jeho zpracovanou verzi, je již načtená. Tato funkce převádí text na malá písmena, provádí tokenizaci a odstraňuje interpunkci. Pandas je naimportovaný jako pd a třída TfidfVectorizer je připravena k použití.

Toto cvičení je součástí kurzu

Zpracování přirozeného jazyka (NLP) v Pythonu

Zobrazit kurz

Pokyny k cvičení

  • Inicializuj TF-IDF vectorizer.
  • Transformuj vyčištěné recenze do tfidf_matrix.
  • Vytvoř DataFrame df pro tfidf_matrix, kde sloupce budou tvořit slova ze slovníku.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

reviews = ["The smart speaker is incredible. Clear sound and fast responses!",
           "I am disappointed with the smart bulb. It stopped working in a week.",
           "The thermostat is okay. Not too smart, but functional."]
cleaned_reviews = [preprocess(review) for review in reviews]

# Initialize the vectorizer
vectorizer = ____
# Transform the cleaned reviews
tfidf_matrix = ____
# Create a DataFrame for TF-IDF
df = pd.DataFrame(
  tfidf_matrix.toarray(),
  columns=vectorizer.____
)
print(df.head())
Upravit a spustit kód