Vizualizace imputací
Analyzovat imputace a vybrat tu nejlepší vyžaduje hodně experimentování. Je důležité zajistit, aby imputací nedošlo ke zkreslení dat. V předchozích dvou cvičeních jsi vytvořil/a 4 různé imputace pomocí průměru, mediánu, modusu a doplnění konstantou.
V tomto cvičení vytvoříš bodový graf DataFramů, které jsi předtím imputoval/a. Za tímto účelem sestavíš slovník těchto DataFramů, kde klíče budou odpovídat jejich názvům.
DataFramy diabetes_mean, diabetes_median, diabetes_mode a diabetes_constant jsou již načteny.
Toto cvičení je součástí kurzu
Dealing with Missing Data in Python
Pokyny k cvičení
- Vytvoř 4 podgrafy tak, že sestavíš graf se 2 řádky a 2 sloupci.
- Vytvoř slovník
imputationstak, že přiřadíš každý klíč k odpovídajícímu DataFramu. - Projdi cyklem
axesaimputationsa vykresli každý DataFrame ze slovníkuimputations. - Nastav barvu podle
nullitya titulek každého podgrafu podle názvu dané imputace.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()
# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___,
'Most Frequent Imputation': ___, 'Constant Imputation': ___}
# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
# Select and also set the title for a DataFrame
imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter',
alpha=0.5, c=___, cmap='rainbow', ax=ax,
colorbar=False, title=___)
plt.show()