Visualiser de nombreuses variables
Lorsque vous commencez à tenir compte d'un plus grand nombre de variables, les tracer toutes en même temps devient de plus en plus difficile. En plus d'utiliser les axes x et y pour deux variables numériques, vous pouvez utiliser la couleur pour une troisième variable numérique, et le facettage pour des variables catégorielles. Et c'est à peu près la limite avant que les graphiques deviennent trop difficiles à interpréter. Il existe certains types de graphiques spécialisés, comme les cartes thermiques de corrélation et les tracés à coordonnées parallèles, qui gèrent davantage de variables, mais ils fournissent beaucoup moins d'information sur chaque variable et ne sont pas idéals pour visualiser les prédictions d'un modèle.
Ici, vous allez repousser les limites du nuage de points en affichant, dans un seul graphique, le prix de la maison, la distance jusqu'à la station MRT, le nombre de dépanneurs à proximité et l'âge de la maison.
taiwan_real_estate est disponible.
Cette activité fait partie du cours
Régression intermédiaire avec statsmodels en Python
Instructions de l’exercice
- Créez une grille de facettes pour chaque
house_age_yearsdanstaiwan_real_estate. - En utilisant l'ensemble de données
taiwan_real_estate, tracez un nuage de points den_convenienceen fonction desqrt_dist_to_mrt_m, coloré selonprice_twd_msq.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Prepare the grid using taiwan_real_estate, for each house age category, colored by price_twd_msq
grid = ____(data=____,
col=____,
hue=____,
palette="plasma")
# Plot the scatterplots with sqrt_dist_to_mrt_m on the x-axis and n_convenience on the y-axis
grid.map(____,
____,
____)
# Show the plot (brighter colors mean higher prices)
plt.show()