НачатьНачать бесплатно

TF-IDF представление отзывов о продуктах

Вы работаете с командой поддержки клиентов в компании, выпускающей устройства для умного дома. Команда собрала отзывы пользователей о различных устройствах и хочет определить, какие слова выделяются в каждом отзыве. Вы предлагаете использовать метод TF-IDF, чтобы выявить наиболее значимые термины в отзывах. Давайте поможем им приступить к работе!

Функция preprocess(), которая принимает текст и возвращает обработанную версию, уже загружена. Эта функция выполняет приведение к нижнему регистру, токенизацию и удаление знаков пунктуации. Библиотека Pandas импортирована как pd, а класс TfidfVectorizer готов к использованию.

Это упражнение является частью курса

Обработка естественного языка (NLP) на Python

Посмотреть курс

Инструкции к упражнению

  • Инициализируйте TF-IDF vectorizer.
  • Преобразуйте очищенные отзывы в tfidf_matrix.
  • Создайте DataFrame df для tfidf_matrix, используя слова из словаря в качестве столбцов.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

reviews = ["The smart speaker is incredible. Clear sound and fast responses!",
           "I am disappointed with the smart bulb. It stopped working in a week.",
           "The thermostat is okay. Not too smart, but functional."]
cleaned_reviews = [preprocess(review) for review in reviews]

# Initialize the vectorizer
vectorizer = ____
# Transform the cleaned reviews
tfidf_matrix = ____
# Create a DataFrame for TF-IDF
df = pd.DataFrame(
  tfidf_matrix.toarray(),
  columns=vectorizer.____
)
print(df.head())
Редактировать и запускать код