Phân tích số chiều và tiền xử lý
Trong bài tập này, bạn được cung cấp một lem_corpus chứa các phiên bản đã tiền xử lý của tagline phim từ bài trước. Nói cách khác, các tagline đã được chuyển về chữ thường, lemmatize và loại bỏ stopword.
Nhiệm vụ của bạn là tạo biểu diễn bag-of-words bow_lem_matrix cho các tagline đã lemmatize này và so sánh kích thước (shape) của nó với bow_matrix thu được ở bài trước. Năm tagline đã lemmatize đầu tiên trong lem_corpus đã được in ra console để bạn quan sát.
Bài tập này là một phần của khóa học
Khai thác đặc trưng cho NLP bằng Python
Hướng dẫn bài tập
- Import lớp
CountVectorizertừsklearn. - Khởi tạo một đối tượng
CountVectorizer. Đặt tên làvectorizer. - Dùng
fit_transform()để tạobow_lem_matrixcholem_corpus.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create CountVectorizer object
____ = ____
# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)
# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)