최종 분류 모델 구축
로지스틱 회귀 모델(0.4)과 가장 성능이 좋은 랜덤 포레스트 모델(0.2)의 재현율(recall) 성능을 비교한 결과, 로지스틱 회귀 모델이 더 우수하다는 것을 확인했습니다. 이번 연습 문제에서는 전체 훈련 데이터를 사용해 로지스틱 회귀 모델을 구축하고, 이 모델의 테스트 성능을 평가하는 데 필요한 벡터를 준비합니다.
이 연습은 강의의 일부입니다
Tidyverse로 배우는 Machine Learning
연습 안내
training_data의 모든 피처를 사용하여Attrition을 예측하는 로지스틱 회귀 모델을 구축하세요.- 실제 테스트 값의 이진 벡터
test_actual을 준비하세요. - 예측 확률이 0.5를 초과하면
TRUE로 판단하는 예측값의 이진 벡터를 준비하고, 이를test_predicted로 저장하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Build the logistic regression model using all training data
best_model <- glm(formula = ___,
data = ___, family = "binomial")
# Prepare binary vector of actual Attrition values for testing_data
test_actual <- testing_data$___ == "___"
# Prepare binary vector of predicted Attrition values for testing_data
test_predicted <- predict(___, ___, type = "response") > ___