EmpezarEmpieza gratis

Visualizar muchas variables

A medida que empiezas a considerar más variables, representarlas todas a la vez se vuelve cada vez más difícil. Además de usar los ejes x e y para dos variables numéricas, puedes usar el color para una tercera variable numérica y usar facetas para variables categóricas. Y ese es más o menos el límite antes de que los gráficos se vuelvan demasiado difíciles de interpretar. Existen algunos tipos de gráficos especializados, como los mapas de calor de correlación y los gráficos de coordenadas paralelas, que permiten manejar más variables, pero ofrecen mucha menos información sobre cada variable y no son ideales para visualizar predicciones de modelos.

Aquí vas a llevar al límite el diagrama de dispersión mostrando el precio de la vivienda, la distancia a la estación de MRT, el número de tiendas de conveniencia cercanas y la antigüedad de la vivienda, todo junto en un único gráfico.

taiwan_real_estate está disponible.

Este ejercicio forma parte del curso

Regresión intermedia con statsmodels en Python

Ver curso

Instrucciones del ejercicio

  • Crea una cuadrícula de facetas para cada house_age_years en taiwan_real_estate.
  • Usando el conjunto de datos taiwan_real_estate, dibuja un diagrama de dispersión de n_convenience frente a sqrt_dist_to_mrt_m, coloreado por price_twd_msq.

ejercicio interactivo práctico

Prueba este ejercicio completando este código de ejemplo.

# Prepare the grid using taiwan_real_estate, for each house age category, colored by price_twd_msq
grid = ____(data=____,
            col=____,
            hue=____,
            palette="plasma")

# Plot the scatterplots with sqrt_dist_to_mrt_m on the x-axis and n_convenience on the y-axis
grid.map(____,
         ____,
         ____)

# Show the plot (brighter colors mean higher prices)
plt.show()
Editar y ejecutar código