Astuces hot-deck II : trier selon des variables corrélées
Une autre astuce qui peut améliorer la performance de l'imputation hot-deck consiste à trier les données selon des variables corrélées à celle que vous voulez imputer.
Par exemple, dans tous les graphiques marginaux que vous avez tracés récemment, vous avez vu que la température de l'air est fortement corrélée à la température de surface de la mer, ce qui est tout à fait logique. Vous pouvez tirer parti de cette information pour améliorer votre imputation hot-deck. Si vous commencez par ordonner les données par sea_surface_temp, alors chaque valeur imputée de air_temp proviendra d'un donneur ayant une sea_surface_temp similaire. Voyons comment cela fonctionne !
Cette activité fait partie du cours
Traitement des données manquantes par imputation dans R
Instructions de l’exercice
- Imputez par hot-deck les valeurs manquantes de
air_tempdans les donnéestao, en ordonnant parsea_surface_temp, et assignez le résultat àtao_imp. - Créez un graphique marginal de
air_tempen fonction desea_surface_temp.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Hot-deck-impute air_temp in tao ordering by sea_surface_temp
tao_imp <- ___(___, ___ = ___, ___ = ___)
# Draw a margin plot of air_temp vs sea_surface_temp
tao_imp %>%
select(air_temp, sea_surface_temp, air_temp_imp) %>%
___(___ = ___)