Analiza frecvenței recenziilor de produse
Acum ai acces la un set de date mai mare de recenzii de produse TechZone. La fel ca înainte, ai preprocesate recenziile și le-ai transformat într-o reprezentare BoW numită X. Sarcina ta acum este să analizezi frecvența cuvintelor și să identifici cei mai comuni termeni din set.
Pentru a facilita analiza, este disponibilă o funcție auxiliară numită get_top_ten(). Aceasta primește o listă de cuvinte și numărul de apariții corespunzător, și returnează cele mai frecvente 10 cuvinte împreună cu numărul lor de apariții.
Acest exercițiu face parte din cursul
Procesarea Limbajului Natural (NLP) în Python
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
def preprocess(text):
text = text.lower()
tokens = word_tokenize(text)
tokens = [word for word in tokens if word not in string.punctuation]
return " ".join(tokens)
cleaned_reviews = [preprocess(review) for review in product_reviews]
X = vectorizer.fit_transform(cleaned_reviews)
# Get word counts
word_counts = np.____(X.____, axis=0)
# Get words
words = vectorizer.____
top_words_with_stopwords, top_counts_with_stopwords = get_top_ten(words, word_counts)
print(top_words_with_stopwords, top_counts_with_stopwords)