Zacznij terazZacznij za darmo

Wizualizacja imputacji

Analizowanie imputacji i wybór najlepszej z nich to zadanie wymagające wielu eksperymentów. Ważne jest, aby dane nie stały się obciążone w wyniku imputacji. W dwóch ostatnich ćwiczeniach utworzyłeś/utworzyłaś 4 różne imputacje: za pomocą średniej, mediany, dominanty oraz wypełnienia stałą wartością.

W tym ćwiczeniu stworzysz wykres punktowy dla wcześniej imputowanych ramek danych. W tym celu utworzysz słownik ramek danych, w którym kluczami będą ich nazwy.

Ramki danych diabetes_mean, diabetes_median, diabetes_mode i diabetes_constant zostały już dla ciebie wczytane.

To ćwiczenie jest częścią kursu

Braki danych w Pythonie

Zobacz kurs

Instrukcje do ćwiczenia

  • Utwórz 4 wykresy podrzędne, tworząc siatkę z 2 wierszami i 2 kolumnami.
  • Utwórz słownik imputations, przypisując każdy klucz do odpowiadającej mu ramki danych.
  • Przejdź w pętli po axes i imputations, a następnie narysuj każdą ramkę danych ze słownika imputations.
  • Ustaw kolor na podstawie wartości nullity oraz tytuł każdego wykresu podrzędnego na nazwę danej imputacji.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()

# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___, 
               'Most Frequent Imputation': ___, 'Constant Imputation': ___}

# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
    # Select and also set the title for a DataFrame
    imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter', 
                          alpha=0.5, c=___, cmap='rainbow', ax=ax, 
                          colorbar=False, title=___)
plt.show()
Edytuj i uruchom kod