CommencerCommencez gratuitement

Imputer des données en dessous de l’intervalle avec des données nabular

Nous voulons garder une trace des valeurs que nous imputons. Sans cela, il est très difficile d’évaluer la qualité des valeurs imputées.

Nous allons nous entraîner à imputer des données et à recréer des visualisations du jeu d’exercices précédent en imputant des valeurs en dessous de l’intervalle des données.

C’est une méthode très utile pour approfondir l’exploration des valeurs manquantes, et elle fournit aussi le cadre pour l’imputation des valeurs manquantes.

Nous allons d’abord imputer les données en dessous de l’intervalle à l’aide de impute_below_all(), puis visualiser les données. Nous remarquons que, même si nous pouvons voir où se situent les valeurs manquantes dans ce cas, il nous faut un moyen de les suivre. Le motif de programmation « track missing data » peut aider à cela.

Cet exercice fait partie du cours

<cours>Gérer les données manquantes en R</cours>
Voir le cours

Instructions de l’exercice

En utilisant les données oceanbuoys :

  • Imputez en dessous de l’intervalle avec impute_below_all().
  • Visualisez les nouvelles valeurs manquantes avec wind_ew sur l’axe des x et air_temp_c sur l’axe des y.
  • Imputez et suivez les données avec bind_shadow(), impute_below_all() et add_label_shadow().
  • Affichez le graphique et examinez les valeurs imputées.

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# Impute the oceanbuoys data below the range using `impute_below`.
ocean_imp <- impute_below_all(___)

# Visualize the new missing values
ggplot(___, 
       aes(x = ___, y = ___)) +  
  geom_point()

# Impute and track data with `bind_shadow`, `impute_below_all`, and `add_label_shadow`
ocean_imp_track <- bind_shadow(___) %>% 
  ___() %>% 
  ___()

# Look at the imputed values
___
Modifier et exécuter le code