Bước 3: Xây dựng bộ phân loại
Đây là bước cuối cùng trong dự đoán phân tích cảm xúc. Chúng ta đã khám phá và làm giàu dữ liệu với các đặc trưng liên quan đến cảm xúc, và chuyển chúng thành các vector số.
Bạn sẽ dùng bộ dữ liệu đã xây dựng ở các bước trước. Cụ thể, nó có một đặc trưng là độ dài review và 200 đặc trưng được tạo bằng bộ biến đổi Tfidf.
Nhiệm vụ của bạn là huấn luyện logistic regression để dự đoán cảm xúc. Dữ liệu đã được nhập sẵn với tên reviews_transformed. Mục tiêu là score và là nhị phân: 1 khi review sản phẩm là tích cực và 0 trong các trường hợp khác.
Hãy huấn luyện một mô hình logistic regression và đánh giá hiệu năng của nó trên dữ liệu kiểm tra. Mô hình hoạt động tốt đến mức nào?
Tất cả các gói cần thiết đã được nhập sẵn cho bạn.
Bài tập này là một phần của khóa học
Phân tích cảm xúc với Python
Hướng dẫn bài tập
- Thực hiện tách train/test, dành 20% dữ liệu cho tập kiểm tra và đặt random seed là
456. - Huấn luyện mô hình logistic regression.
- Dự đoán lớp.
- In ra accuracy và confusion matrix trên tập kiểm tra.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Define X and y
y = reviews_transformed.score
X = reviews_transformed.drop('score', axis=1)
# Train/test split
X_train, X_test, y_train, y_test = ____(____, ____, ____=0.2, ____=456)
# Train a logistic regression
log_reg = ____.____(____, ____)
# Predict the labels
y_predicted = log_reg.____(____)
# Print accuracy score and confusion matrix on test set
print('Accuracy on the test set: ', ____(____, ____))
print(____(____, ____)/len(y_test))