CommencezCommencez gratuitement

Compromis vitesse-précision

Dans la dernière vidéo, vous avez vu qu'il y a deux paramètres que vous pouvez ajuster pour influencer la performance des random forests :

  • Le nombre d'arbres de décision dans chaque forêt.
  • Le nombre de variables utilisées pour le découpage au sein des arbres de décision.

Augmenter l'un ou l'autre peut améliorer la précision du modèle d'imputation, mais cela exigera aussi plus de temps d'exécution. Dans cet exercice, vous allez explorer ces idées par vous-même en appliquant missForest() aux données biopics deux fois avec des réglages différents. En suivant les instructions, portez attention aux erreurs que vous afficherez et au temps d'exécution du code.

Cette activité fait partie du cours

Traitement des données manquantes par imputation dans R

Voir le cours

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Set number of trees to 5 and number of variables used for splitting to 2
imp_res <- missForest(biopics, ___ = ___, ___ = ___)

# Print the resulting imputation errors
print(___)
Modifier et exécuter le code