Visualizar muchas variables
A medida que empiezas a considerar más variables, representarlas todas a la vez se vuelve cada vez más difícil. Además de usar los ejes x e y para dos variables numéricas, puedes usar el color para una tercera variable numérica y usar facetas para variables categóricas. Y ese es más o menos el límite antes de que los gráficos se vuelvan demasiado difíciles de interpretar. Existen algunos tipos de gráficos especializados, como los mapas de calor de correlación y los gráficos de coordenadas paralelas, que permiten manejar más variables, pero ofrecen mucha menos información sobre cada variable y no son ideales para visualizar predicciones de modelos.
Aquí vas a llevar al límite el diagrama de dispersión mostrando el precio de la vivienda, la distancia a la estación de MRT, el número de tiendas de conveniencia cercanas y la antigüedad de la vivienda, todo junto en un único gráfico.
taiwan_real_estate está disponible.
Este ejercicio forma parte del curso
Regresión intermedia con statsmodels en Python
Instrucciones del ejercicio
- Crea una cuadrícula de facetas para cada
house_age_yearsentaiwan_real_estate. - Usando el conjunto de datos
taiwan_real_estate, dibuja un diagrama de dispersión den_conveniencefrente asqrt_dist_to_mrt_m, coloreado porprice_twd_msq.
ejercicio interactivo práctico
Prueba este ejercicio completando este código de ejemplo.
# Prepare the grid using taiwan_real_estate, for each house age category, colored by price_twd_msq
grid = ____(data=____,
col=____,
hue=____,
palette="plasma")
# Plot the scatterplots with sqrt_dist_to_mrt_m on the x-axis and n_convenience on the y-axis
grid.map(____,
____,
____)
# Show the plot (brighter colors mean higher prices)
plt.show()