Wizualizacja imputacji
Analizowanie imputacji i wybór najlepszej z nich to zadanie wymagające wielu eksperymentów. Ważne jest, aby dane nie stały się obciążone w wyniku imputacji. W dwóch ostatnich ćwiczeniach utworzyłeś/utworzyłaś 4 różne imputacje: za pomocą średniej, mediany, dominanty oraz wypełnienia stałą wartością.
W tym ćwiczeniu stworzysz wykres punktowy dla wcześniej imputowanych ramek danych. W tym celu utworzysz słownik ramek danych, w którym kluczami będą ich nazwy.
Ramki danych diabetes_mean, diabetes_median, diabetes_mode i diabetes_constant zostały już dla ciebie wczytane.
To ćwiczenie jest częścią kursu
Braki danych w Pythonie
Instrukcje do ćwiczenia
- Utwórz 4 wykresy podrzędne, tworząc siatkę z 2 wierszami i 2 kolumnami.
- Utwórz słownik
imputations, przypisując każdy klucz do odpowiadającej mu ramki danych. - Przejdź w pętli po
axesiimputations, a następnie narysuj każdą ramkę danych ze słownikaimputations. - Ustaw kolor na podstawie wartości
nullityoraz tytuł każdego wykresu podrzędnego na nazwę danej imputacji.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()
# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___,
'Most Frequent Imputation': ___, 'Constant Imputation': ___}
# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
# Select and also set the title for a DataFrame
imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter',
alpha=0.5, c=___, cmap='rainbow', ax=ax,
colorbar=False, title=___)
plt.show()