Kom igångKom igång gratis

Identifiera MNAR

I föregående övning jobbade du med att identifiera typen av saknade värden utifrån en sammanfattning av missingness. I den här övningen fortsätter du på det spåret och ska på ett säkert sätt identifiera data som är Missing Not at Random (MNAR).

Sammanfattningen av saknade värden för diabetes-DataFramen ser ut som nedan.

Ditt mål är att sortera diabetes-DataFramen på Serum_Insulin och identifiera korrelationen mellan Skin_Fold och Serum_Insulin.

Observera att vi använder en egenutvecklad display()-funktion i stället för plt.show() för att göra det enklare för dig att se utdata.

Den här övningen är en del av kursen

Hantera saknade värden i Python

Visa kurs

Övningsinstruktioner

  • Importera paketet missingno som msno.
  • Sortera värdena i kolumnen Serum_Insulin i diabetes.
  • Visualisera sammanfattningen av saknade värden för Serum_Insulin med msno.matrix().

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Import missingno as msno
___

# Sort diabetes dataframe on 'Serum Insulin'
sorted_values = ___.___(___)

# Visualize the missingness summary of sorted
___.___(___)

# Display nullity matrix
display("/usr/local/share/datasets/matrix_sorted.png")
Redigera och kör kod