Performance de la forêt aléatoire
Il est maintenant temps de vérifier si les modèles de forêts aléatoires que vous avez construits à l'exercice précédent peuvent faire mieux que le modèle de régression logistique.
Rappelez-vous que le rappel sur l'ensemble de validation pour le modèle de régression logistique était de 0,43.
Cette activité fait partie du cours
Machine Learning dans le tidyverse
Instructions de l’exercice
- Préparez les colonnes
validate_actualetvalidate_predictedpour chaque combinaison mtry/plis. - Calculez le rappel pour chaque combinaison mtry/plis.
- Calculez le rappel moyen pour chaque valeur de
mtry.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
cv_prep_rf <- cv_models_rf %>%
mutate(
# Prepare binary vector of actual Attrition values in validate
validate_actual = map(validate, ~.x$___ == "___"),
# Prepare binary vector of predicted Attrition values for validate
validate_predicted = map2(.x = ___, .y = ___, ~predict(.x, .y, type = "response")$predictions == "Yes")
)
# Calculate the validate recall for each cross validation fold
cv_perf_recall <- cv_prep_rf %>%
mutate(recall = map2_dbl(.x = ___, .y = ___, ~recall(actual = .x, predicted = .y)))
# Calculate the mean recall for each mtry used
cv_perf_recall %>%
group_by(___) %>%
summarise(mean_recall = mean(___))