НачатьНачать бесплатно

Построение словаря на основе отзывов покупателей

Вы работаете в команде продуктовой аналитики компании TechZone, занимающейся бытовой электроникой. В ваше распоряжение поступила небольшая выборка отзывов покупателей о новом устройстве. Чтобы проанализировать эти отзывы, необходимо сначала предобработать текст и сформировать словарь — список уникальных слов, который определяет признаки для представления каждого отзыва в числовом виде.

Функция preprocess() уже загружена заранее. Она приводит текст к нижнему регистру, выполняет токенизацию и удаляет знаки препинания.

Это упражнение является частью курса

Обработка естественного языка (NLP) на Python

Посмотреть курс

Инструкции к упражнению

  • Предобработайте каждый отзыв из набора данных с помощью функции preprocess().
  • Обучите vectorizer на предобработанных отзывах.
  • Выведите полученный словарь.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

reviews = [
    "The product is fantastic! It works like a charm.",
    "I hated the product. It broke after one use.",
    "Product was okay, not the best, but fine overall."
]
# Preprocess the reviews
cleaned_reviews = [____ for ____ in ____]

vectorizer = CountVectorizer()
# Fit the vectorizer
vectorizer.____
# Print the vocabulary 
print(vectorizer.____)
Редактировать и запускать код