Évaluer les imputations : l’échelle
Même si l'imputation par la moyenne ne semble pas si mauvaise lorsqu'on la compare avec un diagramme en boîtes, il est essentiel de se faire une idée de la variation dans les données. C’est pourquoi il est important d’examiner comment l’échelle et la dispersion des valeurs imputées évoluent par rapport aux données d’origine.
Une façon d’évaluer la pertinence de l’échelle des imputations est d’utiliser un nuage de points pour vérifier si les valeurs semblent appropriées ou non.
Cet exercice fait partie du cours
<cours>Gérer les données manquantes en R</cours>Instructions de l’exercice
En utilisant les données déjà imputées, ocean_imp_mean :
- Explorez les imputations de la température de l’air (sur l’axe des x) et de l’humidité (sur l’axe des y) à l’aide d’un nuage de points, en n’oubliant pas
color = any_missing. - Améliorez cette visualisation en ajoutant des facettes par année.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Explore imputations in air temperature and humidity,
# coloring by the variable, any_missing
ggplot(___,
aes(x = ___, y = ___, color = ___)) +
geom_point()
# Explore imputations in air temperature and humidity,
# coloring by the variable, any_missing, and faceting by year
ggplot(___,
aes(x = ___, y = ___, color = ___)) +
___() +
facet_wrap(~___)