Bắt đầu ngayBắt đầu miễn phí

Xây dựng mô hình phân loại cuối cùng

Khi so sánh hiệu năng recall giữa mô hình logistic regression (0.4) và mô hình random forest có hiệu năng tốt nhất (0.2), bạn thấy mô hình có hiệu năng tốt nhất là logistic regression. Trong bài tập này, bạn sẽ xây dựng mô hình logistic regression dùng toàn bộ dữ liệu train và chuẩn bị các vector cần thiết để đánh giá hiệu năng test của mô hình này.

Bài tập này là một phần của khóa học

Machine Learning trong tidyverse

Xem khóa học

Hướng dẫn bài tập

  • Xây dựng một mô hình logistic regression dự đoán Attrition sử dụng toàn bộ đặc trưng có trong training_data.
  • Chuẩn bị vector nhị phân của giá trị thực tế trên test, test_actual.
  • Chuẩn bị vector nhị phân của giá trị dự đoán, trong đó xác suất lớn hơn 0.5 được coi là TRUE, và lưu vào test_predicted.

Bài tập tương tác thực hành trực tiếp

Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.

# Build the logistic regression model using all training data
best_model <- glm(formula = ___, 
                  data = ___, family = "binomial")


# Prepare binary vector of actual Attrition values for testing_data
test_actual <- testing_data$___ == "___"

# Prepare binary vector of predicted Attrition values for testing_data
test_predicted <- predict(___, ___, type = "response") > ___
Chỉnh sửa và Chạy Mã