Regrouper l'imputation et la modélisation dans une fonction
Chaque fois que vous effectuez une analyse ou une modélisation sur des données imputées, vous devez tenir compte de l'incertitude liée à l'imputation. Exécuter un modèle sur un jeu de données imputé une seule fois ignore le fait que l'imputation estime les valeurs manquantes avec une certaine incertitude. Les erreurs types d'un tel modèle ont tendance à être trop petites. La solution est l'imputation multiple, et une façon de l'appliquer est le bootstrap.
Dans les prochains exercices, vous utiliserez les données bien connues biopics. L'objectif est d'utiliser l'imputation multiple par bootstrap et la régression linéaire pour voir si, selon les données disponibles, les films biographiques mettant en vedette des femmes rapportent moins que ceux sur des hommes.
Commençons par écrire une fonction qui crée un échantillon bootstrap, l'impute, puis ajuste un modèle de régression linéaire.
Cette activité fait partie du cours
Traitement des données manquantes par imputation dans R
Instructions de l’exercice
- Découpez
datapour rééchantillonner les lignes indiquées parindiceset affectez le résultat àdata_boot. - Imputez l'échantillon bootstrap
data_bootavec l'imputation kNN en utilisant 5 voisins et affectez le résultat àdata_imp. - Ajustez un modèle de régression linéaire à
data_impqui expliqueearningsavecsub_sex,sub_typeetyear.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
calc_gender_coef <- function(data, indices) {
# Get bootstrap sample
data_boot <- data[___, ]
# Impute with kNN imputation
data_imp <- ___
# Fit linear regression
linear_model <- ___
# Extract and return gender coefficient
gender_coefficient <- coef(linear_model)[2]
return(gender_coefficient)
}