TF-IDF cho phần tóm tắt phim
Hãy sử dụng phần tóm tắt của các bộ phim được chọn ngẫu nhiên để thực hiện phân cụm văn bản. Trước khi phân cụm, tài liệu cần được làm sạch nhiễu (như ký tự đặc biệt và stop words) và chuyển thành ma trận thưa thông qua TF-IDF.
Dùng lớp TfidfVectorizer để tính TF-IDF cho các phần tóm tắt phim được lưu trong danh sách plots. Hàm remove_noise() có sẵn để dùng làm tokenizer trong lớp TfidfVectorizer. Phương thức .fit_transform() sẽ fit dữ liệu vào đối tượng TfidfVectorizer và tạo ra ma trận thưa TF-IDF.
Lưu ý: Chạy phương thức .fit_transform() sẽ mất vài giây.
Bài tập này là một phần của khóa học
Phân cụm trong Python
Hướng dẫn bài tập
- Import lớp
TfidfVectorizertừsklearn. - Khởi tạo lớp
TfidfVectorizervới tần suất tối thiểu và tối đa lần lượt là 0.1 và 0.75, và tối đa 50 đặc trưng. - Dùng phương thức
fit_transform()trên đối tượngTfidfVectorizerđã khởi tạo với danh sách plots.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import TfidfVectorizer class from sklearn
from sklearn.feature_extraction.text import ____
# Initialize TfidfVectorizer
tfidf_vectorizer = TfidfVectorizer(____)
# Use the .fit_transform() method on the list plots
tfidf_matrix = ____