Bắt đầu ngayBắt đầu miễn phí

Logistic regression với dữ liệu Twitter

Trong bài tập này, bạn sẽ xây dựng một mô hình logistic regression dùng bộ dữ liệu tweets. Biến mục tiêu là airline_sentiment, có giá trị 0 cho tweet tiêu cực, 1 cho trung tính và 2 cho tích cực. Vì vậy, đây là một bài toán phân loại đa lớp. Mọi điều chúng ta học về bài toán nhị phân cũng áp dụng cho phân loại đa lớp.

Bạn sẽ đánh giá độ chính xác của mô hình bằng hai cách khác nhau như trên các slide.

Hàm logistic regression và accuracy score đã được nhập sẵn cho bạn.

Bài tập này là một phần của khóa học

Phân tích cảm xúc với Python

Xem khóa học

Hướng dẫn bài tập

  • Xây dựng và fit một mô hình logistic regression bằng cách truyền Xy đã định nghĩa làm đối số.
  • Tính độ chính xác (accuracy) của mô hình logistic regression.
  • Dự đoán các nhãn.
  • Tính accuracy score bằng nhãn dự đoán và nhãn thật.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Define the vector of targets and matrix of features
y = tweets.airline_sentiment
X = tweets.drop('airline_sentiment', axis=1)

# Build a logistic regression model and calculate the accuracy
log_reg = ____.____(X, y)
print('Accuracy of logistic regression: ', log_reg.____)

# Create an array of prediction
y_predict = log_reg.____

# Print the accuracy using accuracy score
print('Accuracy of logistic regression: ', ____(___, ____))
Chỉnh sửa và Chạy Mã