Test t pour MAR : préparation des données

Excellent travail pour avoir classé les mécanismes de données manquantes dans le dernier exercice ! Parmi les trois, MAR est sans doute le plus important à détecter, car de nombreuses méthodes d’imputation supposent que les données sont MAR. Cet exercice se concentre donc sur le test de MAR.

Vous allez travailler avec les données familières de biopics. L’objectif est de tester si le nombre de valeurs manquantes dans earnings diffère selon le genre du sujet. Dans cet exercice, vous ne ferez que préparer les données pour le test t. Vous allez d’abord créer une variable indicatrice (dummy) signalant l’absence de valeur dans earnings. Ensuite, vous la scinderez par genre en filtrant d’abord les données pour ne conserver qu’un des genres, puis en extrayant la variable indicatrice. Pour le filtrage, il peut être utile d’imprimer le head() de biopics dans la console et d’examiner la variable du genre.

Cet exercice fait partie du cours

<cours>Gérer les données manquantes avec des imputations en R</cours>

Instructions de l’exercice

Ajoutez à biopics une autre variable appelée missing_earnings qui vaut TRUE si earnings est manquant et FALSE sinon.
Créez un vecteur des valeurs missing_earnings pour les hommes et affectez-le à missing_earnings_males.
Créez un vecteur des valeurs missing_earnings pour les femmes et affectez-le à missing_earnings_females.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a dummy variable for missing earnings
biopics <- biopics %>% 
  ___(missing_earnings = ___(___))

# Pull the missing earnings dummy for males
missing_earnings_males <- biopics %>% 
  ___(___) %>% 
  ___(___)

# Pull the missing earnings dummy for females
missing_earnings_females <- biopics %>% 
  ___(___) %>% 
  ___(___)

Modifier et exécuter le code

Cet exercice fait partie du cours

<cours>Gérer les données manquantes avec des imputations en R</cours>

AvancéNiveau de compétence

4.8+

Commencer le cours gratuitement

Dans ce chapitre, vous découvrirez pourquoi les données manquantes peuvent poser un risque lors de l’analyse d’un jeu de données. Vous serez présenté aux trois mécanismes de données manquantes et apprendrez à les reconnaître à l’aide de tests statistiques et d’outils de visualisation.

Exercise 1: Données manquantes : ce qui peut mal se passer Exercise 2: Régression linéaire avec des données incomplètes Exercise 3: Analyser la sortie d’une régression Exercise 4: Comparer des modèles Exercise 5: Mécanismes des données manquantes Exercise 6: Reconnaître les mécanismes des données manquantes Exercise 7: Test t pour MAR : préparation des données

Exercice actuel

Exercise 8: t-test pour MAR : interprétation Exercise 9: Visualiser les motifs de données manquantes Exercise 10: Graphique d’agrégation Exercise 11: Diagramme en épine (spine plot)Exercise 12: Graphique en mosaïque

Familiarisez-vous avec la taxonomie des méthodes d’imputation et apprenez trois techniques basées sur un donneur : l’imputation par la moyenne, le hot-deck et l’imputation par k plus proches voisins. Vous verrez ce qui se passe sous le capot pour comprendre leur fonctionnement, puis vous apprendrez à les appliquer à un jeu de données réel sur la météo tropicale. Au passage, vous découvrirez aussi des astuces utiles pour les rendre encore plus efficaces dans vos propres problèmes.

Exercise 1: Imputation par la moyenne Exercise 2: Sentir le danger de l’imputation par la moyenne Exercise 3: Imputation par la moyenne de la température Exercise 4: Évaluer la qualité de l’imputation avec un margin plot Exercise 5: Imputation par hot-deck Exercise 6: Hot-deck simple Exercise 7: Astuces hot-deck I : imputer au sein de domaines Exercise 8: Astuces hot-deck II : trier selon des variables corrélées Exercise 9: Imputation par k plus proches voisins Exercise 10: Choisir le nombre de voisins Exercise 11: Astuces kNN I : pondérer les donneurs Exercise 12: Astuces kNN II : trier les variables

Il est temps d’apprendre à utiliser des modèles statistiques et de Machine Learning, comme la régression linéaire, la régression logistique et les forêts aléatoires, pour imputer des données manquantes. Dans ce chapitre, vous examinerez comment les modèles font leurs prédictions et utiliserez ces connaissances pour tirer les valeurs imputées à partir de distributions conditionnelles. C’est essentiel pour garantir des imputations plus variées et plausibles, plus proches des données réelles.

Exercise 1: Approche d’imputation basée sur des modèles Exercise 2: Imputation par régression linéaire Exercise 3: Initialiser les valeurs manquantes et itérer sur les variables Exercise 4: Détecter la convergence Exercise 5: Reproduire la variabilité des données Exercise 6: Imputation par régression logistique Exercise 7: Tirer depuis une distribution conditionnelle Exercise 8: Imputation basée sur des modèles avec plusieurs types de variables Exercise 9: Imputation par arbres de décision Exercise 10: Imputation avec des random forests Exercise 11: Erreurs d’imputation par variable Exercise 12: Compromis entre vitesse et précision

Les valeurs imputées ne sont pas gravées dans la pierre. Ce ne sont que des estimations, et toute estimation comporte une part d’incertitude. Dans ce dernier chapitre, vous verrez comment le bootstrapping et les équations en chaîne avec le package mice permettent d’intégrer l’incertitude d’imputation dans vos modèles et analyses afin de les rendre plus fiables et plus robustes.

Exercise 1: Imputations multiples par bootstrap Exercise 2: Regrouper l’imputation et la modélisation dans une fonction Exercise 3: Exécuter le bootstrap Exercise 4: Intervalles de confiance par bootstrapping Exercise 5: Imputation multiple par équations en chaîne Exercise 6: Le flux mice : mice - with - pool Exercise 7: Choisir des modèles par défaut Exercise 8: Utiliser une matrice de prédicteurs Exercise 9: Réunir le tout Exercise 10: Analyser les motifs de données manquantes Exercise 11: Imputer et inspecter les variables cibles Exercise 12: Inférence avec des données imputées Exercise 13: Remarques finales