Začněte nyníZačněte zdarma

Urči MNAR

V předchozím cvičení jsi identifikoval/a typy chybějících hodnot na základě přehledu missingness. V tomto cvičení budeš pokračovat a jednoznačně identifikuješ data, která jsou Missing Not at Random (MNAR).

Přehled chybějících hodnot pro DataFrame diabetes vypadá takto:

Tvým cílem je seřadit DataFrame diabetes podle sloupce Serum_Insulin a identifikovat závislost mezi sloupci Skin_Fold a Serum_Insulin.

Místo plt.show() používáme vlastní funkci display(), která ti usnadní zobrazení výstupu.

Toto cvičení je součástí kurzu

Dealing with Missing Data in Python

Zobrazit kurz

Pokyny k cvičení

  • Importuj balíček missingno jako msno.
  • Seřaď hodnoty sloupce Serum_Insulin v DataFrame diabetes.
  • Vizualizuj přehled chybějících hodnot pro Serum_Insulin pomocí msno.matrix().

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Import missingno as msno
___

# Sort diabetes dataframe on 'Serum Insulin'
sorted_values = ___.___(___)

# Visualize the missingness summary of sorted
___.___(___)

# Display nullity matrix
display("/usr/local/share/datasets/matrix_sorted.png")
Upravit a spustit kód