Phân tích cảm xúc với GBM
Bây giờ, hãy dùng GradientBoostingClassifier của scikit-learn trên tập dữ liệu reviews để dự đoán cảm xúc của một đánh giá dựa trên nội dung văn bản.
Chúng ta sẽ không đưa thẳng văn bản thô vào mô hình. Các bước tiền xử lý sau đã được thực hiện sẵn cho bạn:
- Loại bỏ các đánh giá bị thiếu giá trị.
- Chọn dữ liệu từ 5 ứng dụng hàng đầu.
- Lấy mẫu ngẫu nhiên 500 đánh giá.
- Loại bỏ "stop words" khỏi các đánh giá.
- Chuyển các đánh giá thành một ma trận, trong đó mỗi đặc trưng biểu diễn tần suất xuất hiện của một từ trong một đánh giá.
Muốn hiểu sâu hơn về khai phá văn bản? Hãy xem khóa học Introduction to Natural Language Processing in Python!
Bài tập này là một phần của khóa học
Ensemble Methods in Python
Hướng dẫn bài tập
- Xây dựng một
GradientBoostingClassifiervới100estimators và learning rate là0.1. - Tính các dự đoán trên tập kiểm tra.
- Tính độ chính xác để đánh giá mô hình.
- Tính và in ra ma trận nhầm lẫn.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Build and fit a Gradient Boosting classifier
clf_gbm = ____(____, ____, random_state=500)
clf_gbm.fit(X_train, y_train)
# Calculate the predictions on the test set
pred = ____
# Evaluate the performance based on the accuracy
acc = ____
print('Accuracy: {:.3f}'.format(acc))
# Get and show the Confusion Matrix
cm = ____
print(cm)