Vector BoW cho bài đánh giá phim
Trong bài này, bạn được cung cấp hai pandas Series là X_train và X_test, chứa các bài đánh giá phim. Chúng lần lượt đại diện cho dữ liệu đánh giá dùng để huấn luyện và để kiểm tra. Nhiệm vụ của bạn là tiền xử lý các bài đánh giá và tạo các vector BoW cho hai tập này bằng CountVectorizer.
Khi đã tạo được các ma trận vector BoW X_train_bow và X_test_bow, chúng ta sẽ ở vị thế rất tốt để áp dụng một mô hình Machine Learning lên đó và thực hiện phân tích cảm xúc.
Bài tập này là một phần của khóa học
Khai thác đặc trưng cho NLP bằng Python
Hướng dẫn bài tập
- Import
CountVectorizertừ thư việnsklearn. - Khởi tạo một đối tượng
CountVectorizertên làvectorizer. Đảm bảo tất cả từ được chuyển thành chữ thường và loại bỏ stopwordenglish. - Dùng
X_trainđể fitvectorizer, sau đó biến đổiX_trainđể tạo tập vector BoWX_train_bow. - Biến đổi
X_testbằngvectorizerđể tạo tập vector BoWX_test_bow.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Import CountVectorizer
from sklearn.feature_extraction.text import ____
# Create a CountVectorizer object
vectorizer = ____(lowercase=____, stop_words=____)
# Fit and transform X_train
X_train_bow = vectorizer.____(____)
# Transform X_test
X_test_bow = vectorizer.____(____)
# Print shape of X_train_bow and X_test_bow
print(X_train_bow.shape)
print(X_test_bow.shape)