Visualisera imputationer
Att analysera imputationer och välja den bästa kräver mycket experimenterande. Det är viktigt att se till att dina data inte blir snedvridna under imputeringen. I de två föregående övningarna skapade du 4 olika imputationer med hjälp av medelvärde, median, typvärde och konstantfyllning.
I den här övningen skapar du ett spridningsdiagram över de DataFrames du imputerade tidigare. För att göra det skapar du en ordlista över DataFrames där nycklarna är deras namn.
DataFrames:en diabetes_mean, diabetes_median, diabetes_mode och diabetes_constant har laddats in åt dig.
Den här övningen är en del av kursen
Hantera saknade värden i Python
Övningsinstruktioner
- Skapa 4 delgrafer genom att rita en graf med 2 rader och 2 kolumner.
- Skapa ordlistan
imputationsgenom att mappa varje nyckel mot motsvarande DataFrame. - Loopa över
axesochimputations, och rita varje DataFrame iimputations. - Sätt färgen till
nullityoch titeln för varje delgraf till imputationens namn.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()
# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___,
'Most Frequent Imputation': ___, 'Constant Imputation': ___}
# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
# Select and also set the title for a DataFrame
imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter',
alpha=0.5, c=___, cmap='rainbow', ax=ax,
colorbar=False, title=___)
plt.show()