Kom igångKom igång gratis

Visualisera imputationer

Att analysera imputationer och välja den bästa kräver mycket experimenterande. Det är viktigt att se till att dina data inte blir snedvridna under imputeringen. I de två föregående övningarna skapade du 4 olika imputationer med hjälp av medelvärde, median, typvärde och konstantfyllning.

I den här övningen skapar du ett spridningsdiagram över de DataFrames du imputerade tidigare. För att göra det skapar du en ordlista över DataFrames där nycklarna är deras namn.

DataFrames:en diabetes_mean, diabetes_median, diabetes_mode och diabetes_constant har laddats in åt dig.

Den här övningen är en del av kursen

Hantera saknade värden i Python

Visa kurs

Övningsinstruktioner

  • Skapa 4 delgrafer genom att rita en graf med 2 rader och 2 kolumner.
  • Skapa ordlistan imputations genom att mappa varje nyckel mot motsvarande DataFrame.
  • Loopa över axes och imputations, och rita varje DataFrame i imputations.
  • Sätt färgen till nullity och titeln för varje delgraf till imputationens namn.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()

# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___, 
               'Most Frequent Imputation': ___, 'Constant Imputation': ___}

# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
    # Select and also set the title for a DataFrame
    imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter', 
                          alpha=0.5, c=___, cmap='rainbow', ax=ax, 
                          colorbar=False, title=___)
plt.show()
Redigera och kör kod