Bắt đầu ngayBắt đầu miễn phí

Phân tích tần suất trong đánh giá sản phẩm

Hiện bạn có một bộ dữ liệu lớn hơn về các đánh giá sản phẩm của TechZone. Cũng như trước đây, bạn đã tiền xử lý và chuyển đổi các đánh giá sang dạng biểu diễn BoW X. Nhiệm vụ của bạn bây giờ là phân tích tần suất từ và xác định các thuật ngữ xuất hiện phổ biến nhất trong bộ dữ liệu.

Để hỗ trợ phân tích, đã cung cấp một hàm tiện ích tên get_top_ten(). Hàm này nhận vào một danh sách các từ và số lần xuất hiện tương ứng, rồi trả về 10 từ xuất hiện thường xuyên nhất cùng với số lần của chúng.

Bài tập này là một phần của khóa học

Natural Language Processing (NLP) bằng Python

Xem khóa học

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

def preprocess(text):
    text = text.lower()
    tokens = word_tokenize(text)
    tokens = [word for word in tokens if word not in string.punctuation]
    return " ".join(tokens)
  
cleaned_reviews = [preprocess(review) for review in product_reviews]
X = vectorizer.fit_transform(cleaned_reviews)

# Get word counts
word_counts = np.____(X.____, axis=0)
# Get words
words = vectorizer.____

top_words_with_stopwords, top_counts_with_stopwords = get_top_ten(words, word_counts)
print(top_words_with_stopwords, top_counts_with_stopwords)
Chỉnh sửa và Chạy Mã