Analyse de la fréquence des évaluations de produits
Vous avez maintenant accès à un jeu de données plus volumineux d'évaluations de produits TechZone. Comme précédemment, vous avez prétraité les évaluations et les avez transformées en une représentation Sac de mots (BoW) X. Votre tâche est maintenant d'analyser les fréquences des mots et d'identifier les termes les plus courants dans le jeu de données.
Pour vous aider dans l'analyse, une fonction utilitaire appelée get_top_ten() est fournie. Elle reçoit une liste de mots et leurs dénombrements correspondants, et retourne les 10 mots les plus fréquents ainsi que leurs fréquences.
Cette activité fait partie du cours
Natural Language Processing (NLP) en Python
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
def preprocess(text):
text = text.lower()
tokens = word_tokenize(text)
tokens = [word for word in tokens if word not in string.punctuation]
return " ".join(tokens)
cleaned_reviews = [preprocess(review) for review in product_reviews]
X = vectorizer.fit_transform(cleaned_reviews)
# Get word counts
word_counts = np.____(X.____, axis=0)
# Get words
words = vectorizer.____
top_words_with_stopwords, top_counts_with_stopwords = get_top_ten(words, word_counts)
print(top_words_with_stopwords, top_counts_with_stopwords)