Построение словаря на основе отзывов покупателей
Вы работаете в команде продуктовой аналитики компании TechZone, занимающейся бытовой электроникой. В ваше распоряжение поступила небольшая выборка отзывов покупателей о новом устройстве. Чтобы проанализировать эти отзывы, необходимо сначала предобработать текст и сформировать словарь — список уникальных слов, который определяет признаки для представления каждого отзыва в числовом виде.
Функция preprocess() уже загружена заранее. Она приводит текст к нижнему регистру, выполняет токенизацию и удаляет знаки препинания.
Это упражнение является частью курса
Обработка естественного языка (NLP) на Python
Инструкции к упражнению
- Предобработайте каждый отзыв из набора данных с помощью функции
preprocess(). - Обучите
vectorizerна предобработанных отзывах. - Выведите полученный словарь.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
reviews = [
"The product is fantastic! It works like a charm.",
"I hated the product. It broke after one use.",
"Product was okay, not the best, but fine overall."
]
# Preprocess the reviews
cleaned_reviews = [____ for ____ in ____]
vectorizer = CountVectorizer()
# Fit the vectorizer
vectorizer.____
# Print the vocabulary
print(vectorizer.____)