Začněte nyníZačněte zdarma

Frekvenční analýza recenzí produktů

Teď máš k dispozici větší datovou sadu recenzí produktů TechZone. Stejně jako předtím jsi recenze předzpracoval/a a převedl/a do reprezentace BoW X. Tvým úkolem je analyzovat frekvence slov a identifikovat nejčastěji se vyskytující výrazy v datové sadě.

Pro usnadnění analýzy je k dispozici pomocná funkce get_top_ten(). Přijímá seznam slov a jejich počty a vrátí 10 nejčastějších slov spolu s jejich počty.

Toto cvičení je součástí kurzu

Zpracování přirozeného jazyka (NLP) v Pythonu

Zobrazit kurz

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

def preprocess(text):
    text = text.lower()
    tokens = word_tokenize(text)
    tokens = [word for word in tokens if word not in string.punctuation]
    return " ".join(tokens)
  
cleaned_reviews = [preprocess(review) for review in product_reviews]
X = vectorizer.fit_transform(cleaned_reviews)

# Get word counts
word_counts = np.____(X.____, axis=0)
# Get words
words = vectorizer.____

top_words_with_stopwords, top_counts_with_stopwords = get_top_ten(words, word_counts)
print(top_words_with_stopwords, top_counts_with_stopwords)
Upravit a spustit kód