CommencezCommencez gratuitement

Le déroulement avec mice : mice - with - pool

L'imputation multiple par équations enchaînées (MICE) permet d'estimer l'incertitude liée à l'imputation en imputant un jeu de données plusieurs fois à l'aide d'une imputation fondée sur des modèles, tout en échantillonnant à partir de distributions conditionnelles. Ainsi, chaque jeu de données imputé est légèrement différent. Ensuite, on réalise une analyse sur chacun d'eux et on regroupe les résultats, ce qui donne les quantités d'intérêt, accompagnées d'intervalles de confiance qui reflètent l'incertitude d'imputation.

Dans cet exercice, vous pratiquerez le déroulement typique de MICE : mice() - with() - pool(). Vous effectuerez une analyse de régression sur les données biopics pour voir quelle profession du sujet, sub_type, est associée aux revenus de film les plus élevés. Amusons-nous avec mice!

Cette activité fait partie du cours

Traitement des données manquantes par imputation dans R

Voir le cours

Instructions de l’exercice

  • Chargez le paquet mice et imputez biopics avec mice() en utilisant 5 imputations, puis assignez le résultat à biopics_multiimp.
  • Ajustez un modèle de régression linéaire qui explique earnings à l'aide de year et sub_type pour chaque jeu de données imputé, puis assignez le résultat à lm_multiimp.
  • Regroupez (pool) les modèles de régression enregistrés dans lm_multiimp, puis assignez le résultat à lm_pooled.
  • Résumez lm_pooled de façon à produire des intervalles de confiance avec un niveau de confiance de 95 %.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Load mice package
___

# Impute biopics with mice using 5 imputations
biopics_multiimp <- ___(___, m = ___, seed = 3108)

# Fit linear regression to each imputed data set 
lm_multiimp <- ___(___, ___)

# Pool and summarize regression results
lm_pooled <- ___(___)
___(___, conf.int = ___, conf.level = ___)
Modifier et exécuter le code