ÎncepețiÎncepe gratuit

Vizualizează imputările

Analizarea imputărilor și alegerea celei mai bune variante este un proces care necesită multă experimentare. Este important să te asiguri că datele nu devin părtinitoare în urma imputării. În ultimele două exerciții, ai creat 4 imputări diferite folosind media, mediana, modul și completarea cu o valoare constantă.

În acest exercițiu, vei crea un grafic de tip scatter pentru DataFrame-urile pe care le-ai imputat anterior. Pentru a face asta, vei crea un dicționar al DataFrame-urilor, unde cheile reprezintă numele fiecăruia.

DataFrame-urile diabetes_mean, diabetes_median, diabetes_mode și diabetes_constant au fost deja încărcate pentru tine.

Acest exercițiu face parte din cursul

Gestionarea datelor lipsă în Python

Vezi cursul

Instrucțiuni pentru exercițiu

  • Creează 4 subgrafice printr-un grafic cu 2 rânduri și 2 coloane.
  • Creează dicționarul imputations asociind fiecare cheie cu DataFrame-ul corespunzător.
  • Iterează peste axes și imputations și reprezentați fiecare DataFrame din imputations.
  • Setează culoarea în funcție de nullity și titlul fiecărui subgrafic la numele imputării.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()

# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___, 
               'Most Frequent Imputation': ___, 'Constant Imputation': ___}

# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
    # Select and also set the title for a DataFrame
    imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter', 
                          alpha=0.5, c=___, cmap='rainbow', ax=ax, 
                          colorbar=False, title=___)
plt.show()
Editează și rulează codul