Začněte nyníZačněte zdarma

Vizualizace imputací

Analyzovat imputace a vybrat tu nejlepší vyžaduje hodně experimentování. Je důležité zajistit, aby imputací nedošlo ke zkreslení dat. V předchozích dvou cvičeních jsi vytvořil/a 4 různé imputace pomocí průměru, mediánu, modusu a doplnění konstantou.

V tomto cvičení vytvoříš bodový graf DataFramů, které jsi předtím imputoval/a. Za tímto účelem sestavíš slovník těchto DataFramů, kde klíče budou odpovídat jejich názvům.

DataFramy diabetes_mean, diabetes_median, diabetes_mode a diabetes_constant jsou již načteny.

Toto cvičení je součástí kurzu

Dealing with Missing Data in Python

Zobrazit kurz

Pokyny k cvičení

  • Vytvoř 4 podgrafy tak, že sestavíš graf se 2 řádky a 2 sloupci.
  • Vytvoř slovník imputations tak, že přiřadíš každý klíč k odpovídajícímu DataFramu.
  • Projdi cyklem axes a imputations a vykresli každý DataFrame ze slovníku imputations.
  • Nastav barvu podle nullity a titulek každého podgrafu podle názvu dané imputace.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()

# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___, 
               'Most Frequent Imputation': ___, 'Constant Imputation': ___}

# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
    # Select and also set the title for a DataFrame
    imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter', 
                          alpha=0.5, c=___, cmap='rainbow', ax=ax, 
                          colorbar=False, title=___)
plt.show()
Upravit a spustit kód