Visualiza las imputaciones
Analizar las imputaciones y elegir la mejor requiere mucha experimentación. Es importante asegurarte de que tus datos no se sesguen durante la imputación. En estos dos últimos ejercicios, creaste 4 imputaciones diferentes usando la media, la mediana, la moda y un valor constante.
En este ejercicio, crearás un diagrama de dispersión de los DataFrames que imputaste anteriormente. Para lograrlo, crearás un diccionario de DataFrames donde las claves sean sus títulos.
Los DataFrames diabetes_mean, diabetes_median, diabetes_mode y diabetes_constant ya se han cargado por ti.
Este ejercicio forma parte del curso
Cómo tratar datos faltantes en Python
Instrucciones del ejercicio
- Crea 4 subgráficos haciendo una figura con 2 filas y 2 columnas.
- Crea el diccionario
imputationsmapeando cada clave con su DataFrame correspondiente. - Itera sobre
axeseimputationsy dibuja cada DataFrame enimputations. - Establece el color en
nullityy el título de cada subgráfico con el nombre de la imputación.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()
# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___,
'Most Frequent Imputation': ___, 'Constant Imputation': ___}
# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
# Select and also set the title for a DataFrame
imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter',
alpha=0.5, c=___, cmap='rainbow', ax=ax,
colorbar=False, title=___)
plt.show()