Mảng tần suất từ tf-idf
Trong bài này, bạn sẽ tạo một mảng tần suất từ tf-idf cho một bộ tài liệu ví dụ nhỏ. Hãy dùng TfidfVectorizer từ sklearn. Công cụ này biến danh sách tài liệu thành một mảng tần suất từ và xuất ra dưới dạng csr_matrix. Nó có các phương thức fit() và transform() giống như các đối tượng sklearn khác.
Bạn được cung cấp danh sách documents gồm các tài liệu ví dụ về thú cưng.
Bài tập này là một phần của khóa học
Unsupervised Learning bằng Python
Hướng dẫn bài tập
- Import
TfidfVectorizertừsklearn.feature_extraction.text. - Tạo một thể hiện
TfidfVectorizerđặt tên làtfidf. - Áp dụng phương thức
.fit_transform()củatfidflêndocumentsvà gán kết quả chocsr_mat. Đây là một mảng tần suất từ ở định dạng csr_matrix. - Khám phá
csr_matbằng cách gọi phương thức.toarray()của nó và in kết quả. Phần này đã được làm sẵn cho bạn. - Các cột của mảng tương ứng với các từ. Lấy danh sách các từ bằng cách gọi phương thức
.get_feature_names_out()củatfidf, và gán kết quả chowords.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import TfidfVectorizer
from ____ import ____
# Create a TfidfVectorizer: tfidf
tfidf = ____
# Apply fit_transform to document: csr_mat
csr_mat = ____
# Print result of toarray() method
print(csr_mat.toarray())
# Get the words: words
words = ____
# Print words
print(words)