Bắt đầu ngayBắt đầu miễn phí

BOW đầu tiên của bạn

Bag-of-words là một cách biến đổi văn bản thành dạng số.

Trong bài tập này, bạn sẽ áp dụng BOW cho danh sách annak trước khi chuyển sang một tập dữ liệu lớn hơn ở bài tiếp theo.

Nhiệm vụ của bạn là làm việc với danh sách này và áp dụng BOW bằng CountVectorizer(). Đây là bước đầu tiên để bạn có thể hiểu cảm xúc (sentiment) của một văn bản. Hãy chú ý đến những từ có thể mang sắc thái cảm xúc mạnh.

Hãy nhớ rằng đầu ra của CountVectorizer() là một ma trận thưa, chỉ lưu các phần tử khác 0. Để xem nội dung thực của ma trận này, ta chuyển nó sang mảng dày bằng phương thức .toarray().

Lưu ý trong trường hợp này bạn không cần chỉ định tham số max_features vì văn bản ngắn.

Bài tập này là một phần của khóa học

Phân tích cảm xúc với Python

Xem khóa học

Hướng dẫn bài tập

  • Import hàm count vectorizer từ sklearn.feature_extraction.text.
  • Xây dựng và fit vectorizer trên tập dữ liệu nhỏ.
  • Tạo biểu diễn BOW với tên anna_bow bằng cách gọi phương thức transform().
  • In kết quả BOW dưới dạng mảng dày (dense array).

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import the required function
____

annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']

# Build the vectorizer and fit it
anna_vect = ____
____.____(annak)

# Create the bow representation
anna_bow = anna_vect.____(annak)

# Print the bag-of-words result 
print(anna_bow.toarray())
Chỉnh sửa và Chạy Mã