Áp dụng TF-IDF cho mô tả sách
PyBooks đã thu thập một số mô tả sách và muốn xác định các từ quan trọng trong đó bằng kỹ thuật mã hóa TF-IDF. Bằng cách này, họ hy vọng hiểu rõ hơn về các thuộc tính độc đáo của từng cuốn sách để hỗ trợ hệ thống gợi ý sách.
Các gói sau đã được nhập sẵn cho bạn: torch, torchtext.
Bài tập này là một phần của khóa học
Deep Learning cho Văn bản với PyTorch
Hướng dẫn bài tập
- Import lớp
TfidfVectorizertừsklearn.feature_extraction.text, lớp này chuyển một tập hợp tài liệu thô thành ma trận các đặc trưng TF-IDF. - Khởi tạo một đối tượng của lớp này, sau đó dùng đối tượng đó để mã hóa
descriptionsthành một ma trận vector TF-IDF. - Lấy và hiển thị năm tên đặc trưng đầu tiên từ
vectorizervà các vector đã mã hóa từtfidf_encoded_descriptions.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Importing TF-IDF from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TF-IDF encoding vectorizer
vectorizer = ____()
tfidf_encoded_descriptions = vectorizer.____(descriptions)
# Extract and print the first five features
print(____.get_feature_names_out()[:5])
print(____.toarray()[0, :5])