Choisir les modèles par défaut
MICE crée un modèle d'imputation distinct pour chaque variable des données. Le type de modèle dépend du type de la variable visée. Une façon courante de préciser les types de modèles à utiliser consiste à définir un modèle par défaut pour chacun des quatre types de variables.
Vous pouvez le faire en passant l'argument defaultMethod à mice(). Il doit s'agir d'un vecteur de longueur 4 contenant les méthodes d'imputation par défaut pour :
- Les variables continues,
- Les variables binaires,
- Les variables catégorielles (facteurs non ordonnés),
- Les variables de type facteur ordonné (ordered factors).
Dans cet exercice, vous allez tirer parti de la documentation de mice pour consulter la liste des méthodes disponibles et choisir celles que l'algorithme doit utiliser. Passons à la sélection de modèles!
Cette activité fait partie du cours
Traitement des données manquantes par imputation dans R
Instructions de l’exercice
- Dans la RDocumentation retournée par
?mice, il y a un tableau qui contient le mot-clé de chaque méthode. - Imputez les données
biopicsavecmice()en utilisant les méthodes par défaut suivantes, dans cet ordre : arbres de classification et de régression, analyse discriminante linéaire, predictive mean matching, modèle des cotes proportionnelles. - Affichez
biopics_multiimppour voir quelle méthode a été utilisée pour chaque variable.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Impute biopics using the methods specified in the instruction
biopics_multiimp <- ___(biopics, m = 20,
defaultMethod = ___)
# Print biopics_multiimp
print(biopics_multiimp)