Vos premières visualisations de données manquantes
Il peut être difficile de repérer où se trouvent les valeurs manquantes dans vos données, et la visualisation est alors d’une grande aide.
La fonction vis_miss() crée une visualisation d’ensemble de la présence de valeurs manquantes dans les données. Elle propose aussi des options pour regrouper les lignes selon les valeurs manquantes avec cluster = TRUE, ainsi que pour trier les colonnes de la plus à la moins manquante (sort_miss = TRUE).
Cet exercice fait partie du cours
<cours>Gérer les données manquantes en R</cours>Instructions de l’exercice
En utilisant le jeu de données riskfactors de naniar :
- Utilisez
vis_miss()pour visualiser les valeurs manquantes dans les données. - Utilisez
vis_miss()aveccluster = TRUEpour explorer des regroupements de valeurs manquantes. - Utilisez
vis_miss()et triez les valeurs manquantes avecsort_misspour ordonner les colonnes selon leur niveau de valeurs manquantes.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Visualize all of the missingness in the `riskfactors` dataset
vis_miss(___)
# Visualize and cluster all of the missingness in the `riskfactors` dataset
vis_miss(___, ___ = TRUE)
# visualize and sort the columns by missingness in the `riskfactors` dataset
vis_miss(___, ___ = TRUE)