Logistic regression với dữ liệu Twitter
Trong bài tập này, bạn sẽ xây dựng một mô hình logistic regression dùng bộ dữ liệu tweets. Biến mục tiêu là airline_sentiment, có giá trị 0 cho tweet tiêu cực, 1 cho trung tính và 2 cho tích cực. Vì vậy, đây là một bài toán phân loại đa lớp. Mọi điều chúng ta học về bài toán nhị phân cũng áp dụng cho phân loại đa lớp.
Bạn sẽ đánh giá độ chính xác của mô hình bằng hai cách khác nhau như trên các slide.
Hàm logistic regression và accuracy score đã được nhập sẵn cho bạn.
Bài tập này là một phần của khóa học
Phân tích cảm xúc với Python
Hướng dẫn bài tập
- Xây dựng và fit một mô hình logistic regression bằng cách truyền
Xvàyđã định nghĩa làm đối số. - Tính độ chính xác (accuracy) của mô hình logistic regression.
- Dự đoán các nhãn.
- Tính accuracy score bằng nhãn dự đoán và nhãn thật.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Define the vector of targets and matrix of features
y = tweets.airline_sentiment
X = tweets.drop('airline_sentiment', axis=1)
# Build a logistic regression model and calculate the accuracy
log_reg = ____.____(X, y)
print('Accuracy of logistic regression: ', log_reg.____)
# Create an array of prediction
y_predict = log_reg.____
# Print the accuracy using accuracy score
print('Accuracy of logistic regression: ', ____(___, ____))