TF-IDF-представлення відгуків про продукт
Ви співпрацюєте з командою підтримки користувачів у компанії розумного дому. Вони зібрали відгуки про різні смартпристрої й хочуть визначити, які слова вирізняються в кожному відгуку. Ви пропонуєте використати підхід TF-IDF, щоб підсвітити найрелевантніші терміни в усіх записах відгуків. Допоможімо їм розпочати!
Функція preprocess(), яка отримує текст і повертає опрацьований, уже завантажена. Вона застосовує перетворення до нижнього регістру, токенізацію та видалення пунктуації. Бібліотеку pandas імпортовано як pd, а клас TfidfVectorizer готовий до використання.
Ця вправа є частиною курсу
Natural Language Processing (NLP) in Python
Інструкції до вправи
- Ініціалізуйте TF-IDF-
vectorizer. - Перетворіть очищені відгуки на
tfidf_matrix. - Створіть датафрейм
dfдляtfidf_matrix, використавши слова словника як назви стовпців.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
reviews = ["The smart speaker is incredible. Clear sound and fast responses!",
"I am disappointed with the smart bulb. It stopped working in a week.",
"The thermostat is okay. Not too smart, but functional."]
cleaned_reviews = [preprocess(review) for review in reviews]
# Initialize the vectorizer
vectorizer = ____
# Transform the cleaned reviews
tfidf_matrix = ____
# Create a DataFrame for TF-IDF
df = pd.DataFrame(
tfidf_matrix.toarray(),
columns=vectorizer.____
)
print(df.head())