Vizualizează imputările
Analizarea imputărilor și alegerea celei mai bune variante este un proces care necesită multă experimentare. Este important să te asiguri că datele nu devin părtinitoare în urma imputării. În ultimele două exerciții, ai creat 4 imputări diferite folosind media, mediana, modul și completarea cu o valoare constantă.
În acest exercițiu, vei crea un grafic de tip scatter pentru DataFrame-urile pe care le-ai imputat anterior. Pentru a face asta, vei crea un dicționar al DataFrame-urilor, unde cheile reprezintă numele fiecăruia.
DataFrame-urile diabetes_mean, diabetes_median, diabetes_mode și diabetes_constant au fost deja încărcate pentru tine.
Acest exercițiu face parte din cursul
Gestionarea datelor lipsă în Python
Instrucțiuni pentru exercițiu
- Creează 4 subgrafice printr-un grafic cu 2 rânduri și 2 coloane.
- Creează dicționarul
imputationsasociind fiecare cheie cu DataFrame-ul corespunzător. - Iterează peste
axesșiimputationsși reprezentați fiecare DataFrame dinimputations. - Setează culoarea în funcție de
nullityși titlul fiecărui subgrafic la numele imputării.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()
# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___,
'Most Frequent Imputation': ___, 'Constant Imputation': ___}
# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
# Select and also set the title for a DataFrame
imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter',
alpha=0.5, c=___, cmap='rainbow', ax=ax,
colorbar=False, title=___)
plt.show()