Bắt đầu ngayBắt đầu miễn phí

Mảng tần suất từ tf-idf

Trong bài này, bạn sẽ tạo một mảng tần suất từ tf-idf cho một bộ tài liệu ví dụ nhỏ. Hãy dùng TfidfVectorizer từ sklearn. Công cụ này biến danh sách tài liệu thành một mảng tần suất từ và xuất ra dưới dạng csr_matrix. Nó có các phương thức fit()transform() giống như các đối tượng sklearn khác.

Bạn được cung cấp danh sách documents gồm các tài liệu ví dụ về thú cưng.

Bài tập này là một phần của khóa học

Unsupervised Learning bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Import TfidfVectorizer từ sklearn.feature_extraction.text.
  • Tạo một thể hiện TfidfVectorizer đặt tên là tfidf.
  • Áp dụng phương thức .fit_transform() của tfidf lên documents và gán kết quả cho csr_mat. Đây là một mảng tần suất từ ở định dạng csr_matrix.
  • Khám phá csr_mat bằng cách gọi phương thức .toarray() của nó và in kết quả. Phần này đã được làm sẵn cho bạn.
  • Các cột của mảng tương ứng với các từ. Lấy danh sách các từ bằng cách gọi phương thức .get_feature_names_out() của tfidf, và gán kết quả cho words.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import TfidfVectorizer
from ____ import ____

# Create a TfidfVectorizer: tfidf
tfidf = ____ 

# Apply fit_transform to document: csr_mat
csr_mat = ____

# Print result of toarray() method
print(csr_mat.toarray())

# Get the words: words
words = ____

# Print words
print(words)
Chỉnh sửa và Chạy Mã