ПочатиПочніть безкоштовно

Аналіз частотності у відгуках про товари

Тепер у вас є доступ до більшого набору даних із відгуками про товари TechZone. Як і раніше, ви попередньо опрацювали відгуки та перетворили їх у подання BoW X. Ваше завдання — проаналізувати частоти слів і визначити найуживаніші терміни в наборі даних.

Для допомоги в аналізі надано допоміжну функцію get_top_ten(). Вона приймає список слів і їхні відповідні кількості та повертає 10 найчастотніших слів разом із їхніми підрахунками.

Ця вправа є частиною курсу

Natural Language Processing (NLP) in Python

Переглянути курс

Інтерактивна практична вправа

Спробуйте виконати цю вправу, доповнивши цей зразок коду.

def preprocess(text):
    text = text.lower()
    tokens = word_tokenize(text)
    tokens = [word for word in tokens if word not in string.punctuation]
    return " ".join(tokens)
  
cleaned_reviews = [preprocess(review) for review in product_reviews]
X = vectorizer.fit_transform(cleaned_reviews)

# Get word counts
word_counts = np.____(X.____, axis=0)
# Get words
words = vectorizer.____

top_words_with_stopwords, top_counts_with_stopwords = get_top_ten(words, word_counts)
print(top_words_with_stopwords, top_counts_with_stopwords)
Редагувати та запускати код