ÎncepețiÎncepe gratuit

Analiza frecvenței recenziilor de produse

Acum ai acces la un set de date mai mare de recenzii de produse TechZone. La fel ca înainte, ai preprocesate recenziile și le-ai transformat într-o reprezentare BoW numită X. Sarcina ta acum este să analizezi frecvența cuvintelor și să identifici cei mai comuni termeni din set.

Pentru a facilita analiza, este disponibilă o funcție auxiliară numită get_top_ten(). Aceasta primește o listă de cuvinte și numărul de apariții corespunzător, și returnează cele mai frecvente 10 cuvinte împreună cu numărul lor de apariții.

Acest exercițiu face parte din cursul

Procesarea Limbajului Natural (NLP) în Python

Vezi cursul

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

def preprocess(text):
    text = text.lower()
    tokens = word_tokenize(text)
    tokens = [word for word in tokens if word not in string.punctuation]
    return " ".join(tokens)
  
cleaned_reviews = [preprocess(review) for review in product_reviews]
X = vectorizer.fit_transform(cleaned_reviews)

# Get word counts
word_counts = np.____(X.____, axis=0)
# Get words
words = vectorizer.____

top_words_with_stopwords, top_counts_with_stopwords = get_top_ten(words, word_counts)
print(top_words_with_stopwords, top_counts_with_stopwords)
Editează și rulează codul