EmpezarEmpieza gratis

Visualiza las imputaciones

Analizar las imputaciones y elegir la mejor requiere mucha experimentación. Es importante asegurarte de que tus datos no se sesguen durante la imputación. En estos dos últimos ejercicios, creaste 4 imputaciones diferentes usando la media, la mediana, la moda y un valor constante.

En este ejercicio, crearás un diagrama de dispersión de los DataFrames que imputaste anteriormente. Para lograrlo, crearás un diccionario de DataFrames donde las claves sean sus títulos.

Los DataFrames diabetes_mean, diabetes_median, diabetes_mode y diabetes_constant ya se han cargado por ti.

Este ejercicio forma parte del curso

Cómo tratar datos faltantes en Python

Ver curso

Instrucciones del ejercicio

  • Crea 4 subgráficos haciendo una figura con 2 filas y 2 columnas.
  • Crea el diccionario imputations mapeando cada clave con su DataFrame correspondiente.
  • Itera sobre axes e imputations y dibuja cada DataFrame en imputations.
  • Establece el color en nullity y el título de cada subgráfico con el nombre de la imputación.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Set nrows and ncols to 2
fig, axes = plt.subplots(nrows=___, ncols=___, figsize=(10, 10))
nullity = diabetes.Serum_Insulin.isnull()+diabetes.Glucose.isnull()

# Create a dictionary of imputations
imputations = {'Mean Imputation': ___, 'Median Imputation': ___, 
               'Most Frequent Imputation': ___, 'Constant Imputation': ___}

# Loop over flattened axes and imputations
for ax, df_key in zip(___.___(), ___):
    # Select and also set the title for a DataFrame
    imputations[___].plot(x='Serum_Insulin', y='Glucose', kind='scatter', 
                          alpha=0.5, c=___, cmap='rainbow', ax=ax, 
                          colorbar=False, title=___)
plt.show()
Editar y ejecutar código