НачатьНачать бесплатно

Частотный анализ отзывов о товарах

Теперь у вас есть доступ к расширенному набору данных с отзывами о товарах TechZone. Как и прежде, отзывы прошли предобработку и преобразованы в представление «мешок слов» (BoW) X. Ваша задача — проанализировать частоту слов и найти наиболее часто встречающиеся термины в наборе данных.

Для удобства анализа предусмотрена вспомогательная функция get_top_ten(). Она принимает список слов и соответствующие им частоты, а возвращает 10 самых распространённых слов вместе с их счётчиками.

Это упражнение является частью курса

Обработка естественного языка (NLP) на Python

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

def preprocess(text):
    text = text.lower()
    tokens = word_tokenize(text)
    tokens = [word for word in tokens if word not in string.punctuation]
    return " ".join(tokens)
  
cleaned_reviews = [preprocess(review) for review in product_reviews]
X = vectorizer.fit_transform(cleaned_reviews)

# Get word counts
word_counts = np.____(X.____, axis=0)
# Get words
words = vectorizer.____

top_words_with_stopwords, top_counts_with_stopwords = get_top_ten(words, word_counts)
print(top_words_with_stopwords, top_counts_with_stopwords)
Редактировать и запускать код