Erreurs d'imputation par variable
Dans l'exercice précédent, vous avez extrait les erreurs d'imputation estimées à partir de la sortie de missForest. Vous avez obtenu deux nombres :
- l'erreur quadratique moyenne normalisée (NRMSE) pour toutes les variables continues ;
- la proportion d'entrées mal classées (PFC) pour toutes les variables catégorielles.
Cependant, il est tout à fait possible que le modèle d'imputation fonctionne très bien pour une variable continue et mal pour une autre ! Pour diagnostiquer ce genre de situation, il suffit d'indiquer à missForest de produire des estimations d'erreur par variable. Pour ce faire, réglez l'argument variablewise à TRUE.
Les données biopics et le paquet missForest sont déjà chargés pour vous. Examinons donc les erreurs de plus près !
Cette activité fait partie du cours
Traitement des données manquantes par imputation dans R
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Impute biopics data with missForest computing per-variable errors
imp_res <- ___(___, ___ = ___)