Frekvensanalys av produktrecensioner
Du har nu tillgång till en större datamängd med produktrecensioner från TechZone. Precis som tidigare har du förbehandlat och omvandlat recensionerna till en BoW-representation X. Din uppgift är nu att analysera ordfrekvenserna och identifiera de vanligaste termerna i datamängden.
Som hjälp finns en hjälpfunktion kallad get_top_ten(). Den tar emot en lista med ord och deras motsvarande antal, och returnerar de 10 mest förekommande orden tillsammans med deras antal.
Den här övningen är en del av kursen
Natural Language Processing (NLP) i Python
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
def preprocess(text):
text = text.lower()
tokens = word_tokenize(text)
tokens = [word for word in tokens if word not in string.punctuation]
return " ".join(tokens)
cleaned_reviews = [preprocess(review) for review in product_reviews]
X = vectorizer.fit_transform(cleaned_reviews)
# Get word counts
word_counts = np.____(X.____, axis=0)
# Get words
words = vectorizer.____
top_words_with_stopwords, top_counts_with_stopwords = get_top_ten(words, word_counts)
print(top_words_with_stopwords, top_counts_with_stopwords)