Test t pour MAR : préparation des données
Excellent travail pour avoir classé les mécanismes de données manquantes au dernier exercice ! Des trois, MAR est sans doute le plus important à détecter, puisque plusieurs méthodes d'imputation supposent que les données sont MAR. Cet exercice portera donc sur un test visant MAR.
Vous allez travailler avec les données bien connues biopics. L'objectif est de vérifier si le nombre de valeurs manquantes dans earnings diffère selon le genre du sujet. Dans cet exercice, vous allez seulement préparer les données pour le test t. D'abord, vous créerez une variable indicatrice (dummy) qui signale l'absence de valeur dans earnings. Ensuite, vous la diviserez par genre en filtrant d'abord les données pour ne garder qu'un des genres, puis en extrayant la variable indicatrice. Pour le filtrage, il peut être utile d'afficher le head() de biopics dans la console pour examiner la variable du genre.
Cette activité fait partie du cours
Traitement des données manquantes par imputation dans R
Instructions de l’exercice
- Ajoutez une autre variable à
biopicsappeléemissing_earningsqui estTRUEsiearningsest manquant etFALSEautrement. - Créez un vecteur des valeurs
missing_earningspour les hommes et assignez-le àmissing_earnings_males. - Créez un vecteur des valeurs
missing_earningspour les femmes et assignez-le àmissing_earnings_females.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Create a dummy variable for missing earnings
biopics <- biopics %>%
___(missing_earnings = ___(___))
# Pull the missing earnings dummy for males
missing_earnings_males <- biopics %>%
___(___) %>%
___(___)
# Pull the missing earnings dummy for females
missing_earnings_females <- biopics %>%
___(___) %>%
___(___)