Compromis vitesse-précision
Dans la dernière vidéo, vous avez vu qu'il y a deux paramètres que vous pouvez ajuster pour influencer la performance des random forests :
- Le nombre d'arbres de décision dans chaque forêt.
- Le nombre de variables utilisées pour le découpage au sein des arbres de décision.
Augmenter l'un ou l'autre peut améliorer la précision du modèle d'imputation, mais cela exigera aussi plus de temps d'exécution. Dans cet exercice, vous allez explorer ces idées par vous-même en appliquant missForest() aux données biopics deux fois avec des réglages différents. En suivant les instructions, portez attention aux erreurs que vous afficherez et au temps d'exécution du code.
Cette activité fait partie du cours
Traitement des données manquantes par imputation dans R
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Set number of trees to 5 and number of variables used for splitting to 2
imp_res <- missForest(biopics, ___ = ___, ___ = ___)
# Print the resulting imputation errors
print(___)