Le flux mice : mice - with - pool

L’imputation multiple par équations en chaîne (MICE) permet d’estimer l’incertitude due à l’imputation en imputant plusieurs fois un même jeu de données avec une imputation basée sur des modèles, tout en tirant dans des distributions conditionnelles. Ainsi, chaque jeu de données imputé est légèrement différent. Ensuite, on réalise une analyse sur chacun d’eux et on regroupe les résultats, ce qui fournit les quantités d’intérêt, accompagnées d’intervalles de confiance qui reflètent l’incertitude d’imputation.

Dans cet exercice, vous allez pratiquer le flux MICE classique : mice() - with() - pool(). Vous effectuerez une analyse de régression sur les données biopics pour voir quelle profession du sujet, sub_type, est associée aux recettes de film les plus élevées. Jouons avec mice !

Cet exercice fait partie du cours

Gérer les données manquantes avec des imputations en R

Afficher le cours

Instructions

Chargez le package mice et imputez biopics avec mice() en utilisant 5 imputations, en enregistrant le résultat dans biopics_multiimp.
Ajustez un modèle de régression linéaire qui explique earnings à l’aide de year et sub_type pour chaque jeu de données imputé, et enregistrez le résultat dans lm_multiimp.
Regroupez les modèles de régression sauvegardés dans lm_multiimp avec pool(), et enregistrez le résultat dans lm_pooled.
Résumez lm_pooled de façon à produire des intervalles de confiance avec un niveau de confiance de 95 %.

Exercice interactif pratique

Essayez cet exercice en complétant cet exemple de code.

# Load mice package
___

# Impute biopics with mice using 5 imputations
biopics_multiimp <- ___(___, m = ___, seed = 3108)

# Fit linear regression to each imputed data set 
lm_multiimp <- ___(___, ___)

# Pool and summarize regression results
lm_pooled <- ___(___)
___(___, conf.int = ___, conf.level = ___)

Modifier et exécuter le code

Cet exercice fait partie du cours

Gérer les données manquantes avec des imputations en R

AvancéNiveau de compétence

4.8+

Commencer le cours gratuitement

Dans ce chapitre, vous découvrirez pourquoi les données manquantes peuvent poser un risque lors de l’analyse d’un jeu de données. Vous serez présenté aux trois mécanismes de données manquantes et apprendrez à les reconnaître à l’aide de tests statistiques et d’outils de visualisation.

Exercise 1: Données manquantes : ce qui peut mal se passer Exercise 2: Régression linéaire avec des données incomplètes Exercise 3: Analyser la sortie d’une régression Exercise 4: Comparer des modèles Exercise 5: Mécanismes des données manquantes Exercise 6: Reconnaître les mécanismes des données manquantes Exercise 7: Test t pour MAR : préparation des données Exercise 8: t-test pour MAR : interprétation Exercise 9: Visualiser les motifs de données manquantes Exercise 10: Graphique d’agrégation Exercise 11: Diagramme en épine (spine plot)Exercise 12: Graphique en mosaïque

Familiarisez-vous avec la taxonomie des méthodes d’imputation et apprenez trois techniques basées sur un donneur : l’imputation par la moyenne, le hot-deck et l’imputation par k plus proches voisins. Vous verrez ce qui se passe sous le capot pour comprendre leur fonctionnement, puis vous apprendrez à les appliquer à un jeu de données réel sur la météo tropicale. Au passage, vous découvrirez aussi des astuces utiles pour les rendre encore plus efficaces dans vos propres problèmes.

Exercise 1: Imputation par la moyenne Exercise 2: Sentir le danger de l’imputation par la moyenne Exercise 3: Imputation par la moyenne de la température Exercise 4: Évaluer la qualité de l’imputation avec un margin plot Exercise 5: Imputation par hot-deck Exercise 6: Hot-deck simple Exercise 7: Astuces hot-deck I : imputer au sein de domaines Exercise 8: Astuces hot-deck II : trier selon des variables corrélées Exercise 9: Imputation par k plus proches voisins Exercise 10: Choisir le nombre de voisins Exercise 11: Astuces kNN I : pondérer les donneurs Exercise 12: Astuces kNN II : trier les variables

Il est temps d’apprendre à utiliser des modèles statistiques et de Machine Learning, comme la régression linéaire, la régression logistique et les forêts aléatoires, pour imputer des données manquantes. Dans ce chapitre, vous examinerez comment les modèles font leurs prédictions et utiliserez ces connaissances pour tirer les valeurs imputées à partir de distributions conditionnelles. C’est essentiel pour garantir des imputations plus variées et plausibles, plus proches des données réelles.

Exercise 1: Approche d’imputation basée sur des modèles Exercise 2: Imputation par régression linéaire Exercise 3: Initialiser les valeurs manquantes et itérer sur les variables Exercise 4: Détecter la convergence Exercise 5: Reproduire la variabilité des données Exercise 6: Imputation par régression logistique Exercise 7: Tirer depuis une distribution conditionnelle Exercise 8: Imputation basée sur des modèles avec plusieurs types de variables Exercise 9: Imputation par arbres de décision Exercise 10: Imputation avec des random forests Exercise 11: Erreurs d’imputation par variable Exercise 12: Compromis entre vitesse et précision

Les valeurs imputées ne sont pas gravées dans la pierre. Ce ne sont que des estimations, et toute estimation comporte une part d’incertitude. Dans ce dernier chapitre, vous verrez comment le bootstrapping et les équations en chaîne avec le package mice permettent d’intégrer l’incertitude d’imputation dans vos modèles et analyses afin de les rendre plus fiables et plus robustes.

Exercise 1: Imputations multiples par bootstrap Exercise 2: Regrouper l’imputation et la modélisation dans une fonction Exercise 3: Exécuter le bootstrap Exercise 4: Intervalles de confiance par bootstrapping Exercise 5: Imputation multiple par équations en chaîne Exercise 6: Le flux mice : mice - with - pool

Exercice en cours

Exercise 7: Choisir des modèles par défaut Exercise 8: Utiliser une matrice de prédicteurs Exercise 9: Réunir le tout Exercise 10: Analyser les motifs de données manquantes Exercise 11: Imputer et inspecter les variables cibles Exercise 12: Inférence avec des données imputées Exercise 13: Remarques finales