CommencezCommencez gratuitement

Regrouper l'imputation et la modélisation dans une fonction

Chaque fois que vous effectuez une analyse ou une modélisation sur des données imputées, vous devez tenir compte de l'incertitude liée à l'imputation. Exécuter un modèle sur un jeu de données imputé une seule fois ignore le fait que l'imputation estime les valeurs manquantes avec une certaine incertitude. Les erreurs types d'un tel modèle ont tendance à être trop petites. La solution est l'imputation multiple, et une façon de l'appliquer est le bootstrap.

Dans les prochains exercices, vous utiliserez les données bien connues biopics. L'objectif est d'utiliser l'imputation multiple par bootstrap et la régression linéaire pour voir si, selon les données disponibles, les films biographiques mettant en vedette des femmes rapportent moins que ceux sur des hommes.

Commençons par écrire une fonction qui crée un échantillon bootstrap, l'impute, puis ajuste un modèle de régression linéaire.

Cette activité fait partie du cours

Traitement des données manquantes par imputation dans R

Voir le cours

Instructions de l’exercice

  • Découpez data pour rééchantillonner les lignes indiquées par indices et affectez le résultat à data_boot.
  • Imputez l'échantillon bootstrap data_boot avec l'imputation kNN en utilisant 5 voisins et affectez le résultat à data_imp.
  • Ajustez un modèle de régression linéaire à data_imp qui explique earnings avec sub_sex, sub_type et year.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

calc_gender_coef <- function(data, indices) {
  # Get bootstrap sample
  data_boot <- data[___, ]
  # Impute with kNN imputation
  data_imp <- ___
  # Fit linear regression
  linear_model <- ___
  # Extract and return gender coefficient
  gender_coefficient <- coef(linear_model)[2]
  return(gender_coefficient)
}
Modifier et exécuter le code