Bắt đầu ngayBắt đầu miễn phí

Phân tích số chiều và tiền xử lý

Trong bài tập này, bạn được cung cấp một lem_corpus chứa các phiên bản đã tiền xử lý của tagline phim từ bài trước. Nói cách khác, các tagline đã được chuyển về chữ thường, lemmatize và loại bỏ stopword.

Nhiệm vụ của bạn là tạo biểu diễn bag-of-words bow_lem_matrix cho các tagline đã lemmatize này và so sánh kích thước (shape) của nó với bow_matrix thu được ở bài trước. Năm tagline đã lemmatize đầu tiên trong lem_corpus đã được in ra console để bạn quan sát.

Bài tập này là một phần của khóa học

Khai thác đặc trưng cho NLP bằng Python

Xem khóa học

Hướng dẫn bài tập

  • Import lớp CountVectorizer từ sklearn.
  • Khởi tạo một đối tượng CountVectorizer. Đặt tên là vectorizer.
  • Dùng fit_transform() để tạo bow_lem_matrix cho lem_corpus.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Import CountVectorizer
from sklearn.feature_extraction.text import ____

# Create CountVectorizer object
____ = ____

# Generate matrix of word vectors
bow_lem_matrix = ____.____(lem_corpus)

# Print the shape of bow_lem_matrix
print(bow_lem_matrix.shape)
Chỉnh sửa và Chạy Mã