BOW đầu tiên của bạn
Bag-of-words là một cách biến đổi văn bản thành dạng số.
Trong bài tập này, bạn sẽ áp dụng BOW cho danh sách annak trước khi chuyển sang một tập dữ liệu lớn hơn ở bài tiếp theo.
Nhiệm vụ của bạn là làm việc với danh sách này và áp dụng BOW bằng CountVectorizer(). Đây là bước đầu tiên để bạn có thể hiểu cảm xúc (sentiment) của một văn bản. Hãy chú ý đến những từ có thể mang sắc thái cảm xúc mạnh.
Hãy nhớ rằng đầu ra của CountVectorizer() là một ma trận thưa, chỉ lưu các phần tử khác 0. Để xem nội dung thực của ma trận này, ta chuyển nó sang mảng dày bằng phương thức .toarray().
Lưu ý trong trường hợp này bạn không cần chỉ định tham số max_features vì văn bản ngắn.
Bài tập này là một phần của khóa học
Phân tích cảm xúc với Python
Hướng dẫn bài tập
- Import hàm count vectorizer từ
sklearn.feature_extraction.text. - Xây dựng và fit vectorizer trên tập dữ liệu nhỏ.
- Tạo biểu diễn BOW với tên
anna_bowbằng cách gọi phương thứctransform(). - In kết quả BOW dưới dạng mảng dày (dense array).
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import the required function
____
annak = ['Happy families are all alike;', 'every unhappy family is unhappy in its own way']
# Build the vectorizer and fit it
anna_vect = ____
____.____(annak)
# Create the bow representation
anna_bow = anna_vect.____(annak)
# Print the bag-of-words result
print(anna_bow.toarray())