LoslegenKostenlos starten

MNAR herleiten

In der vorherigen Übung hast du anhand der Missingness-Zusammenfassung den Typ der fehlenden Werte identifiziert. In dieser Übung machst du damit weiter und identifizierst gezielt Daten, die Missing Not at Random (MNAR) sind.

Die Missingness-Zusammenfassung für den diabetes-DataFrame findest du unten.

Dein Ziel ist es, den diabetes-DataFrame nach Serum_Insulin zu sortieren und die Korrelation zwischen Skin_Fold und Serum_Insulin zu identifizieren.

Beachte, dass wir statt plt.show() eine proprietäre display()-Funktion verwendet haben, damit du die Ausgabe einfacher ansehen kannst.

Diese Übung ist Teil des Kurses

<Kurs>Umgang mit fehlenden Daten in Python</Kurs>
Kurs ansehen

Übungsanweisungen

  • Importiere das Paket missingno als msno.
  • Sortiere die Werte der Spalte Serum_Insulin in diabetes.
  • Visualisiere die Missingness-Zusammenfassung von Serum_Insulin mit msno.matrix().

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Import missingno as msno
___

# Sort diabetes dataframe on 'Serum Insulin'
sorted_values = ___.___(___)

# Visualize the missingness summary of sorted
___.___(___)

# Display nullity matrix
display("/usr/local/share/datasets/matrix_sorted.png")
Code bearbeiten und ausführen