Performance de la random forest
Il est temps de vérifier si les modèles de random forests que vous avez construits dans l’exercice précédent surpassent le modèle de régression logistique.
Rappelez-vous que le rappel sur l’ensemble de validation pour le modèle de régression logistique était de 0,43.
Cet exercice fait partie du cours
<cours>Machine Learning dans le tidyverse</cours>Instructions de l’exercice
- Préparez les colonnes
validate_actualetvalidate_predictedpour chaque combinaison mtry/pli. - Calculez le rappel pour chaque combinaison mtry/pli.
- Calculez le rappel moyen pour chaque valeur de
mtry.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
cv_prep_rf <- cv_models_rf %>%
mutate(
# Prepare binary vector of actual Attrition values in validate
validate_actual = map(validate, ~.x$___ == "___"),
# Prepare binary vector of predicted Attrition values for validate
validate_predicted = map2(.x = ___, .y = ___, ~predict(.x, .y, type = "response")$predictions == "Yes")
)
# Calculate the validate recall for each cross validation fold
cv_perf_recall <- cv_prep_rf %>%
mutate(recall = map2_dbl(.x = ___, .y = ___, ~recall(actual = .x, predicted = .y)))
# Calculate the mean recall for each mtry used
cv_perf_recall %>%
group_by(___) %>%
summarise(mean_recall = mean(___))