Bắt đầu ngayBắt đầu miễn phí

Bag-of-words cho tiêu đề sách

PyBooks hiện có một danh sách tiêu đề sách cần được mã hóa để phân tích sâu hơn. Nhóm dữ liệu cho rằng mô hình Bag of Words (BoW) có thể là cách tiếp cận tốt nhất.

Các gói sau đã được nhập sẵn cho bạn: torch, torchtext.

Bài tập này là một phần của khóa học

Deep Learning cho Văn bản với PyTorch

Xem khóa học

Hướng dẫn bài tập

  • Nhập lớp CountVectorizer để triển khai bag-of-words.
  • Khởi tạo một đối tượng từ lớp bạn vừa nhập, sau đó dùng đối tượng này để biến đổi titles thành biểu diễn ma trận.
  • Trích xuất và hiển thị năm tên đặc trưng đầu tiên và các tiêu đề đã mã hóa bằng phương thức get_feature_names_out().

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import from sklearn
from sklearn.feature_extraction.text import ____

titles = ['The Great Gatsby','To Kill a Mockingbird','1984','The Catcher in the Rye','The Hobbit', 'Great Expectations']

# Initialize Bag-of-words with the list of book titles
vectorizer = ____()
bow_encoded_titles = ____.fit_transform(____)

# Extract and print the first five features
print(vectorizer.____[:5])
print(bow_encoded_titles.toarray()[0, :5])
Chỉnh sửa và Chạy Mã