Vos premières visualisations de données manquantes
Il peut être difficile de repérer où se trouvent les valeurs manquantes dans vos données, et c'est là que la visualisation devient très utile.
La fonction vis_miss() crée une visualisation d'ensemble de la présence de valeurs manquantes dans les données. Elle offre aussi des options pour regrouper les lignes selon les valeurs manquantes, à l'aide de cluster = TRUE, ainsi que pour trier les colonnes, de la plus manquante à la moins manquante (sort_miss = TRUE).
Cette activité fait partie du cours
Gérer les données manquantes avec R
Instructions de l’exercice
En utilisant l'ensemble de données riskfactors de naniar :
- Utilisez
vis_miss()pour visualiser la présence de valeurs manquantes dans les données. - Utilisez
vis_miss()aveccluster = TRUEpour explorer des regroupements de valeurs manquantes. - Utilisez
vis_miss()et triez les valeurs manquantes avecsort_misspour ordonner les colonnes selon la proportion de valeurs manquantes.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Visualize all of the missingness in the `riskfactors` dataset
vis_miss(___)
# Visualize and cluster all of the missingness in the `riskfactors` dataset
vis_miss(___, ___ = TRUE)
# visualize and sort the columns by missingness in the `riskfactors` dataset
vis_miss(___, ___ = TRUE)