CommencezCommencez gratuitement

Test t pour MAR : préparation des données

Excellent travail pour avoir classé les mécanismes de données manquantes au dernier exercice ! Des trois, MAR est sans doute le plus important à détecter, puisque plusieurs méthodes d'imputation supposent que les données sont MAR. Cet exercice portera donc sur un test visant MAR.

Vous allez travailler avec les données bien connues biopics. L'objectif est de vérifier si le nombre de valeurs manquantes dans earnings diffère selon le genre du sujet. Dans cet exercice, vous allez seulement préparer les données pour le test t. D'abord, vous créerez une variable indicatrice (dummy) qui signale l'absence de valeur dans earnings. Ensuite, vous la diviserez par genre en filtrant d'abord les données pour ne garder qu'un des genres, puis en extrayant la variable indicatrice. Pour le filtrage, il peut être utile d'afficher le head() de biopics dans la console pour examiner la variable du genre.

Cette activité fait partie du cours

Traitement des données manquantes par imputation dans R

Voir le cours

Instructions de l’exercice

  • Ajoutez une autre variable à biopics appelée missing_earnings qui est TRUE si earnings est manquant et FALSE autrement.
  • Créez un vecteur des valeurs missing_earnings pour les hommes et assignez-le à missing_earnings_males.
  • Créez un vecteur des valeurs missing_earnings pour les femmes et assignez-le à missing_earnings_females.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Create a dummy variable for missing earnings
biopics <- biopics %>% 
  ___(missing_earnings = ___(___))

# Pull the missing earnings dummy for males
missing_earnings_males <- biopics %>% 
  ___(___) %>% 
  ___(___)

# Pull the missing earnings dummy for females
missing_earnings_females <- biopics %>% 
  ___(___) %>% 
  ___(___)
Modifier et exécuter le code