Le déroulement avec mice : mice - with - pool
L'imputation multiple par équations enchaînées (MICE) permet d'estimer l'incertitude liée à l'imputation en imputant un jeu de données plusieurs fois à l'aide d'une imputation fondée sur des modèles, tout en échantillonnant à partir de distributions conditionnelles. Ainsi, chaque jeu de données imputé est légèrement différent. Ensuite, on réalise une analyse sur chacun d'eux et on regroupe les résultats, ce qui donne les quantités d'intérêt, accompagnées d'intervalles de confiance qui reflètent l'incertitude d'imputation.
Dans cet exercice, vous pratiquerez le déroulement typique de MICE : mice() - with() - pool(). Vous effectuerez une analyse de régression sur les données biopics pour voir quelle profession du sujet, sub_type, est associée aux revenus de film les plus élevés. Amusons-nous avec mice!
Cette activité fait partie du cours
Traitement des données manquantes par imputation dans R
Instructions de l’exercice
- Chargez le paquet
miceet imputezbiopicsavecmice()en utilisant 5 imputations, puis assignez le résultat àbiopics_multiimp. - Ajustez un modèle de régression linéaire qui explique
earningsà l'aide deyearetsub_typepour chaque jeu de données imputé, puis assignez le résultat àlm_multiimp. - Regroupez (pool) les modèles de régression enregistrés dans
lm_multiimp, puis assignez le résultat àlm_pooled. - Résumez
lm_pooledde façon à produire des intervalles de confiance avec un niveau de confiance de 95 %.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Load mice package
___
# Impute biopics with mice using 5 imputations
biopics_multiimp <- ___(___, m = ___, seed = 3108)
# Fit linear regression to each imputed data set
lm_multiimp <- ___(___, ___)
# Pool and summarize regression results
lm_pooled <- ___(___)
___(___, conf.int = ___, conf.level = ___)