CommencezCommencez gratuitement

Performance de la forêt aléatoire

Il est maintenant temps de vérifier si les modèles de forêts aléatoires que vous avez construits à l'exercice précédent peuvent faire mieux que le modèle de régression logistique.

Rappelez-vous que le rappel sur l'ensemble de validation pour le modèle de régression logistique était de 0,43.

Cette activité fait partie du cours

Machine Learning dans le tidyverse

Voir le cours

Instructions de l’exercice

  • Préparez les colonnes validate_actual et validate_predicted pour chaque combinaison mtry/plis.
  • Calculez le rappel pour chaque combinaison mtry/plis.
  • Calculez le rappel moyen pour chaque valeur de mtry.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

cv_prep_rf <- cv_models_rf %>% 
  mutate(
    # Prepare binary vector of actual Attrition values in validate
    validate_actual = map(validate, ~.x$___ == "___"),
    # Prepare binary vector of predicted Attrition values for validate
    validate_predicted = map2(.x = ___, .y = ___, ~predict(.x, .y, type = "response")$predictions == "Yes")
  )

# Calculate the validate recall for each cross validation fold
cv_perf_recall <- cv_prep_rf %>% 
  mutate(recall = map2_dbl(.x = ___, .y = ___, ~recall(actual = .x, predicted = .y)))

# Calculate the mean recall for each mtry used  
cv_perf_recall %>% 
  group_by(___) %>% 
  summarise(mean_recall = mean(___))
Modifier et exécuter le code