Zacznij terazZacznij za darmo

Analiza częstotliwości recenzji produktów

Masz teraz dostęp do większego zbioru danych z recenzjami produktów TechZone. Podobnie jak wcześniej, wstępnie przetworzyłeś recenzje i przekształciłeś je w reprezentację BoW X. Twoim zadaniem jest teraz analiza częstotliwości słów i identyfikacja najczęściej występujących terminów w zbiorze danych.

Do analizy udostępniono funkcję pomocniczą get_top_ten(). Przyjmuje ona listę słów wraz z odpowiadającymi im liczbami wystąpień i zwraca 10 najczęstszych słów wraz z ich liczebnościami.

To ćwiczenie jest częścią kursu

Przetwarzanie języka naturalnego (NLP) w Pythonie

Zobacz kurs

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

def preprocess(text):
    text = text.lower()
    tokens = word_tokenize(text)
    tokens = [word for word in tokens if word not in string.punctuation]
    return " ".join(tokens)
  
cleaned_reviews = [preprocess(review) for review in product_reviews]
X = vectorizer.fit_transform(cleaned_reviews)

# Get word counts
word_counts = np.____(X.____, axis=0)
# Get words
words = vectorizer.____

top_words_with_stopwords, top_counts_with_stopwords = get_top_ten(words, word_counts)
print(top_words_with_stopwords, top_counts_with_stopwords)
Edytuj i uruchom kod