ПочатиПочніть безкоштовно

TF-IDF-представлення відгуків про продукт

Ви співпрацюєте з командою підтримки користувачів у компанії розумного дому. Вони зібрали відгуки про різні смартпристрої й хочуть визначити, які слова вирізняються в кожному відгуку. Ви пропонуєте використати підхід TF-IDF, щоб підсвітити найрелевантніші терміни в усіх записах відгуків. Допоможімо їм розпочати!

Функція preprocess(), яка отримує текст і повертає опрацьований, уже завантажена. Вона застосовує перетворення до нижнього регістру, токенізацію та видалення пунктуації. Бібліотеку pandas імпортовано як pd, а клас TfidfVectorizer готовий до використання.

Ця вправа є частиною курсу

Natural Language Processing (NLP) in Python

Переглянути курс

Інструкції до вправи

  • Ініціалізуйте TF-IDF-vectorizer.
  • Перетворіть очищені відгуки на tfidf_matrix.
  • Створіть датафрейм df для tfidf_matrix, використавши слова словника як назви стовпців.

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

reviews = ["The smart speaker is incredible. Clear sound and fast responses!",
           "I am disappointed with the smart bulb. It stopped working in a week.",
           "The thermostat is okay. Not too smart, but functional."]
cleaned_reviews = [preprocess(review) for review in reviews]

# Initialize the vectorizer
vectorizer = ____
# Transform the cleaned reviews
tfidf_matrix = ____
# Create a DataFrame for TF-IDF
df = pd.DataFrame(
  tfidf_matrix.toarray(),
  columns=vectorizer.____
)
print(df.head())
Редагувати та запускати код