Bắt đầu ngayBắt đầu miễn phí

Áp dụng TF-IDF cho mô tả sách

PyBooks đã thu thập một số mô tả sách và muốn xác định các từ quan trọng trong đó bằng kỹ thuật mã hóa TF-IDF. Bằng cách này, họ hy vọng hiểu rõ hơn về các thuộc tính độc đáo của từng cuốn sách để hỗ trợ hệ thống gợi ý sách.

Các gói sau đã được nhập sẵn cho bạn: torch, torchtext.

Bài tập này là một phần của khóa học

Deep Learning cho Văn bản với PyTorch

Xem khóa học

Hướng dẫn bài tập

  • Import lớp TfidfVectorizer từ sklearn.feature_extraction.text, lớp này chuyển một tập hợp tài liệu thô thành ma trận các đặc trưng TF-IDF.
  • Khởi tạo một đối tượng của lớp này, sau đó dùng đối tượng đó để mã hóa descriptions thành một ma trận vector TF-IDF.
  • Lấy và hiển thị năm tên đặc trưng đầu tiên từ vectorizer và các vector đã mã hóa từ tfidf_encoded_descriptions.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)

# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])
Chỉnh sửa và Chạy Mã