Évaluer les imputations : l'échelle
Même si l'imputation par la moyenne peut ne pas sembler si mauvaise lorsqu'on la compare avec un diagramme en boîtes, il est essentiel de se faire une idée de la variation dans les données. C'est pourquoi il est important d'examiner comment l'échelle et la dispersion des valeurs imputées changent par rapport aux données d'origine.
Une façon d'évaluer si l'échelle des imputations est appropriée consiste à utiliser un nuage de points pour vérifier si les valeurs semblent plausibles ou non.
Cette activité fait partie du cours
Gérer les données manquantes avec R
Instructions de l’exercice
En utilisant les données avec valeurs déjà imputées, ocean_imp_mean :
- Explorez les imputations de la température de l'air (sur l'axe des x) et de l'humidité (sur l'axe des y) à l'aide d'un nuage de points, en pensant à utiliser
color = any_missing. - Améliorez cette visualisation en créant des facettes par année.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Explore imputations in air temperature and humidity,
# coloring by the variable, any_missing
ggplot(___,
aes(x = ___, y = ___, color = ___)) +
geom_point()
# Explore imputations in air temperature and humidity,
# coloring by the variable, any_missing, and faceting by year
ggplot(___,
aes(x = ___, y = ___, color = ___)) +
___() +
facet_wrap(~___)