TF-IDF reprezentace zpětné vazby k produktům
Pracuješ s týmem zákaznické podpory ve firmě vyrábějící chytré domácí spotřebiče. Tým shromáždil zpětnou vazbu uživatelů k různým chytrým zařízením a chce zjistit, která slova v jednotlivých recenzích nejvíce vynikají. Navrhuješ použít techniku TF-IDF, která pomůže identifikovat nejrelevantnější výrazy napříč všemi záznamy. Pojďme jim s tím pomoct!
Funkce preprocess(), která přijme text a vrátí jeho zpracovanou verzi, je již načtená. Tato funkce převádí text na malá písmena, provádí tokenizaci a odstraňuje interpunkci. Pandas je naimportovaný jako pd a třída TfidfVectorizer je připravena k použití.
Toto cvičení je součástí kurzu
Zpracování přirozeného jazyka (NLP) v Pythonu
Pokyny k cvičení
- Inicializuj TF-IDF
vectorizer. - Transformuj vyčištěné recenze do
tfidf_matrix. - Vytvoř DataFrame
dfprotfidf_matrix, kde sloupce budou tvořit slova ze slovníku.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
reviews = ["The smart speaker is incredible. Clear sound and fast responses!",
"I am disappointed with the smart bulb. It stopped working in a week.",
"The thermostat is okay. Not too smart, but functional."]
cleaned_reviews = [preprocess(review) for review in reviews]
# Initialize the vectorizer
vectorizer = ____
# Transform the cleaned reviews
tfidf_matrix = ____
# Create a DataFrame for TF-IDF
df = pd.DataFrame(
tfidf_matrix.toarray(),
columns=vectorizer.____
)
print(df.head())