Déduire MNAR
Dans l'exercice précédent, vous avez travaillé à identifier le type de valeurs manquantes à partir du sommaire des données manquantes. Dans cet exercice, vous allez poursuivre sur cette lancée pour identifier avec certitude des données Missing Not at Random (MNAR), c'est‑à‑dire « manquantes non aléatoirement ».
Le sommaire des valeurs manquantes pour le DataFrame diabetes est présenté ci‑dessous.

Votre objectif est de trier le DataFrame diabetes selon Serum_Insulin et d'identifier la corrélation entre Skin_Fold et Serum_Insulin.
Notez que nous utilisons une fonction exclusive display() au lieu de plt.show() pour vous faciliter la visualisation du résultat.
Cette activité fait partie du cours
Gérer les données manquantes avec Python
Instructions de l’exercice
- Importez le paquet
missingnosous le nommsno. - Triez les valeurs de la colonne
Serum_Insulindansdiabetes. - Visualisez le sommaire des valeurs manquantes de
Serum_Insulinavecmsno.matrix().
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Import missingno as msno
___
# Sort diabetes dataframe on 'Serum Insulin'
sorted_values = ___.___(___)
# Visualize the missingness summary of sorted
___.___(___)
# Display nullity matrix
display("/usr/local/share/datasets/matrix_sorted.png")