Bắt đầu ngayBắt đầu miễn phí

Các chỉ số hiệu năng trên dữ liệu Twitter

Bạn sẽ huấn luyện một mô hình logistic regression để dự đoán cảm xúc của các tweet và đánh giá hiệu năng của nó trên tập kiểm tra bằng nhiều chỉ số khác nhau.

Một ma trận X đã được tạo sẵn. Nó chứa các đặc trưng được xây dựng bằng BOW từ cột text.

Các nhãn được lưu trong vector y. Vector y có giá trị 0 cho tweet tiêu cực, 1 cho trung tính và 2 cho tích cực.
Lưu ý rằng mặc dù có 3 lớp, đây vẫn là một bài toán phân loại. Accuracy vẫn đo lường tỷ lệ dự đoán đúng. Ma trận nhầm lẫn giờ sẽ có kích thước 3x3: mỗi hàng cho biết số lượng trường hợp được dự đoán cho các lớp 2, 1 và 0; mỗi cột cho biết số lượng thực tế của các trường hợp thuộc lớp 2, 1 và 0.

Tất cả các gói cần thiết đã được import sẵn cho bạn.

Bài tập này là một phần của khóa học

Phân tích cảm xúc với Python

Xem khóa học

Hướng dẫn bài tập

  • Thực hiện tách train/test và stratify theo y.
  • Huấn luyện một bộ phân loại logistic regression.
  • Dự đoán và đánh giá trên tập kiểm tra.
  • In ra accuracy và ma trận nhầm lẫn thu được trên tập kiểm tra.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Split the data into training and testing sets
X_train, X_test, y_train, y_test = ____(X, y, test_size=0.3, random_state=123, ____=y)

# Train a logistic regression
log_reg = ____.____(___, ____)

# Make predictions on the test set
y_predicted = log_reg.____(___)

# Print the performance metrics
print('Accuracy score test set: ', ____(y_test, y_predicted))
print('Confusion matrix test set: \n', ____(y_test, y_predicted)/len(y_test))
Chỉnh sửa và Chạy Mã