CommencezCommencez gratuitement

Produire des résumés groupés de la présence de valeurs manquantes

Maintenant que vous pouvez créer des données nabular, utilisons-les pour explorer les données. Calculons des statistiques sommaires selon la présence de valeurs manquantes dans une autre variable.

Pour ce faire, nous allons suivre les étapes suivantes :

  • D'abord, bind_shadow() transforme les données en données nabular.

  • Ensuite, faites des résumés des données avec group_by() et summarize() pour calculer la moyenne et l'écart type, à l'aide des fonctions mean() et sd().

Cette activité fait partie du cours

Gérer les données manquantes avec R

Voir le cours

Instructions de l’exercice

  • Pour l'ensemble de données oceanbuoys :

  • Appliquez bind_shadow(), puis group_by() sur la présence de valeurs manquantes pour humidity (humidity_NA) et calculez les moyennes et écarts types pour le vent est-ouest (wind_ew) au moyen de summarize() de dplyr.

  • Répétez l'opération, mais en calculant les résumés pour le vent nord-sud (wind_ns).

Exercice interactif pratique

Essayez cet exercice en complétant ce code d’exemple.

# `bind_shadow()` and `group_by()` humidity missingness (`humidity_NA`)
oceanbuoys %>%
  ___() %>%
  group_by(___) %>% 
  summarize(wind_ew_mean = mean(___), # calculate mean of wind_ew
            wind_ew_sd = ___)) # calculate standard deviation of wind_ew
  
# Repeat this, but calculating summaries for wind north south (`wind_ns`).
___ %>%
  ___ %>%
  group_by(___) %>%
  summarize(___ = ___(___),
            ___ = ___(___))
Modifier et exécuter le code