Bắt đầu ngayBắt đầu miễn phí

TF-IDF cho phần tóm tắt phim

Hãy sử dụng phần tóm tắt của các bộ phim được chọn ngẫu nhiên để thực hiện phân cụm văn bản. Trước khi phân cụm, tài liệu cần được làm sạch nhiễu (như ký tự đặc biệt và stop words) và chuyển thành ma trận thưa thông qua TF-IDF.

Dùng lớp TfidfVectorizer để tính TF-IDF cho các phần tóm tắt phim được lưu trong danh sách plots. Hàm remove_noise() có sẵn để dùng làm tokenizer trong lớp TfidfVectorizer. Phương thức .fit_transform() sẽ fit dữ liệu vào đối tượng TfidfVectorizer và tạo ra ma trận thưa TF-IDF.

Lưu ý: Chạy phương thức .fit_transform() sẽ mất vài giây.

Bài tập này là một phần của khóa học

Phân cụm trong Python

Xem khóa học

Hướng dẫn bài tập

  • Import lớp TfidfVectorizer từ sklearn.
  • Khởi tạo lớp TfidfVectorizer với tần suất tối thiểu và tối đa lần lượt là 0.1 và 0.75, và tối đa 50 đặc trưng.
  • Dùng phương thức fit_transform() trên đối tượng TfidfVectorizer đã khởi tạo với danh sách plots.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____

# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)

# Use the .fit_transform() method on the list plots
tfidf_matrix = ____
Chỉnh sửa và Chạy Mã