Xây dựng mô hình phân loại cuối cùng
Khi so sánh hiệu năng recall giữa mô hình logistic regression (0.4) và mô hình random forest có hiệu năng tốt nhất (0.2), bạn thấy mô hình có hiệu năng tốt nhất là logistic regression. Trong bài tập này, bạn sẽ xây dựng mô hình logistic regression dùng toàn bộ dữ liệu train và chuẩn bị các vector cần thiết để đánh giá hiệu năng test của mô hình này.
Bài tập này là một phần của khóa học
Machine Learning trong tidyverse
Hướng dẫn bài tập
- Xây dựng một mô hình logistic regression dự đoán
Attritionsử dụng toàn bộ đặc trưng có trongtraining_data. - Chuẩn bị vector nhị phân của giá trị thực tế trên test,
test_actual. - Chuẩn bị vector nhị phân của giá trị dự đoán, trong đó xác suất lớn hơn 0.5 được coi là
TRUE, và lưu vàotest_predicted.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Build the logistic regression model using all training data
best_model <- glm(formula = ___,
data = ___, family = "binomial")
# Prepare binary vector of actual Attrition values for testing_data
test_actual <- testing_data$___ == "___"
# Prepare binary vector of predicted Attrition values for testing_data
test_predicted <- predict(___, ___, type = "response") > ___