CommencezCommencez gratuitement

Choisir les modèles par défaut

MICE crée un modèle d'imputation distinct pour chaque variable des données. Le type de modèle dépend du type de la variable visée. Une façon courante de préciser les types de modèles à utiliser consiste à définir un modèle par défaut pour chacun des quatre types de variables.

Vous pouvez le faire en passant l'argument defaultMethod à mice(). Il doit s'agir d'un vecteur de longueur 4 contenant les méthodes d'imputation par défaut pour :

  1. Les variables continues,
  2. Les variables binaires,
  3. Les variables catégorielles (facteurs non ordonnés),
  4. Les variables de type facteur ordonné (ordered factors).

Dans cet exercice, vous allez tirer parti de la documentation de mice pour consulter la liste des méthodes disponibles et choisir celles que l'algorithme doit utiliser. Passons à la sélection de modèles!

Cette activité fait partie du cours

Traitement des données manquantes par imputation dans R

Voir le cours

Instructions de l’exercice

  • Dans la RDocumentation retournée par ?mice, il y a un tableau qui contient le mot-clé de chaque méthode.
  • Imputez les données biopics avec mice() en utilisant les méthodes par défaut suivantes, dans cet ordre : arbres de classification et de régression, analyse discriminante linéaire, predictive mean matching, modèle des cotes proportionnelles.
  • Affichez biopics_multiimp pour voir quelle méthode a été utilisée pour chaque variable.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Impute biopics using the methods specified in the instruction
biopics_multiimp <- ___(biopics, m = 20, 
                         defaultMethod = ___)

# Print biopics_multiimp
print(biopics_multiimp)
Modifier et exécuter le code