ÎncepețiÎncepe gratuit

Identifică MNAR

În exercițiul anterior, ai lucrat la identificarea tipului de valori lipsă pe baza sumarului de valori lipsă. În acest exercițiu, vei continua în aceeași direcție pentru a identifica cu certitudine datele care sunt Missing Not at Random (MNAR).

Sumarul valorilor lipsă pentru DataFrame-ul diabetes este prezentat mai jos.

Obiectivul tău este să sortezi DataFrame-ul diabetes după Serum_Insulin și să identifici corelația dintre Skin_Fold și Serum_Insulin.

Reține că am folosit o funcție proprietară display() în locul plt.show(), pentru a-ți face mai ușoară vizualizarea rezultatelor.

Acest exercițiu face parte din cursul

Gestionarea datelor lipsă în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Importă pachetul missingno ca msno.
  • Sortează valorile coloanei Serum_Insulin din diabetes.
  • Vizualizează sumarul valorilor lipsă pentru Serum_Insulin folosind msno.matrix().

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Import missingno as msno
___

# Sort diabetes dataframe on 'Serum Insulin'
sorted_values = ___.___(___)

# Visualize the missingness summary of sorted
___.___(___)

# Display nullity matrix
display("/usr/local/share/datasets/matrix_sorted.png")
Editează și rulează codul