Bag-of-words cho tiêu đề sách
PyBooks hiện có một danh sách tiêu đề sách cần được mã hóa để phân tích sâu hơn. Nhóm dữ liệu cho rằng mô hình Bag of Words (BoW) có thể là cách tiếp cận tốt nhất.
Các gói sau đã được nhập sẵn cho bạn: torch, torchtext.
Bài tập này là một phần của khóa học
Deep Learning cho Văn bản với PyTorch
Hướng dẫn bài tập
- Nhập lớp
CountVectorizerđể triển khai bag-of-words. - Khởi tạo một đối tượng từ lớp bạn vừa nhập, sau đó dùng đối tượng này để biến đổi
titlesthành biểu diễn ma trận. - Trích xuất và hiển thị năm tên đặc trưng đầu tiên và các tiêu đề đã mã hóa bằng phương thức
get_feature_names_out().
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import from sklearn
from sklearn.feature_extraction.text import ____
titles = ['The Great Gatsby','To Kill a Mockingbird','1984','The Catcher in the Rye','The Hobbit', 'Great Expectations']
# Initialize Bag-of-words with the list of book titles
vectorizer = ____()
bow_encoded_titles = ____.fit_transform(____)
# Extract and print the first five features
print(vectorizer.____[:5])
print(bow_encoded_titles.toarray()[0, :5])