Kom igångKom igång gratis

Frekvensanalys av produktrecensioner

Du har nu tillgång till en större datamängd med produktrecensioner från TechZone. Precis som tidigare har du förbehandlat och omvandlat recensionerna till en BoW-representation X. Din uppgift är nu att analysera ordfrekvenserna och identifiera de vanligaste termerna i datamängden.

Som hjälp finns en hjälpfunktion kallad get_top_ten(). Den tar emot en lista med ord och deras motsvarande antal, och returnerar de 10 mest förekommande orden tillsammans med deras antal.

Den här övningen är en del av kursen

Natural Language Processing (NLP) i Python

Visa kurs

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

def preprocess(text):
    text = text.lower()
    tokens = word_tokenize(text)
    tokens = [word for word in tokens if word not in string.punctuation]
    return " ".join(tokens)
  
cleaned_reviews = [preprocess(review) for review in product_reviews]
X = vectorizer.fit_transform(cleaned_reviews)

# Get word counts
word_counts = np.____(X.____, axis=0)
# Get words
words = vectorizer.____

top_words_with_stopwords, top_counts_with_stopwords = get_top_ten(words, word_counts)
print(top_words_with_stopwords, top_counts_with_stopwords)
Redigera och kör kod