랜덤 포레스트 성능
이제 이전 연습 문제에서 구축한 랜덤 포레스트 모델이 로지스틱 회귀 모델보다 더 나은 성능을 발휘하는지 확인해 볼 차례입니다.
로지스틱 회귀 모델의 검증 재현율(recall)은 0.43이었음을 기억하세요.
이 연습은 강의의 일부입니다
Tidyverse로 배우는 Machine Learning
연습 안내
- 각 mtry/폴드 조합에 대해
validate_actual열과validate_predicted열을 준비하세요. - 각 mtry/폴드 조합의 재현율(recall)을 계산하세요.
- 각
mtry값에 대한 평균 재현율(recall)을 계산하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
cv_prep_rf <- cv_models_rf %>%
mutate(
# Prepare binary vector of actual Attrition values in validate
validate_actual = map(validate, ~.x$___ == "___"),
# Prepare binary vector of predicted Attrition values for validate
validate_predicted = map2(.x = ___, .y = ___, ~predict(.x, .y, type = "response")$predictions == "Yes")
)
# Calculate the validate recall for each cross validation fold
cv_perf_recall <- cv_prep_rf %>%
mutate(recall = map2_dbl(.x = ___, .y = ___, ~recall(actual = .x, predicted = .y)))
# Calculate the mean recall for each mtry used
cv_perf_recall %>%
group_by(___) %>%
summarise(mean_recall = mean(___))