CommencerCommencez gratuitement

Performance de la random forest

Il est temps de vérifier si les modèles de random forests que vous avez construits dans l’exercice précédent surpassent le modèle de régression logistique.

Rappelez-vous que le rappel sur l’ensemble de validation pour le modèle de régression logistique était de 0,43.

Cet exercice fait partie du cours

<cours>Machine Learning dans le tidyverse</cours>
Voir le cours

Instructions de l’exercice

  • Préparez les colonnes validate_actual et validate_predicted pour chaque combinaison mtry/pli.
  • Calculez le rappel pour chaque combinaison mtry/pli.
  • Calculez le rappel moyen pour chaque valeur de mtry.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

cv_prep_rf <- cv_models_rf %>% 
  mutate(
    # Prepare binary vector of actual Attrition values in validate
    validate_actual = map(validate, ~.x$___ == "___"),
    # Prepare binary vector of predicted Attrition values for validate
    validate_predicted = map2(.x = ___, .y = ___, ~predict(.x, .y, type = "response")$predictions == "Yes")
  )

# Calculate the validate recall for each cross validation fold
cv_perf_recall <- cv_prep_rf %>% 
  mutate(recall = map2_dbl(.x = ___, .y = ___, ~recall(actual = .x, predicted = .y)))

# Calculate the mean recall for each mtry used  
cv_perf_recall %>% 
  group_by(___) %>% 
  summarise(mean_recall = mean(___))
Modifier et exécuter le code