Veel variabelen visualiseren
Als je meer variabelen gaat bekijken, wordt het steeds lastiger om ze allemaal tegelijk te plotten. Naast het gebruik van x- en y-schalen voor twee numerieke variabelen, kun je kleur gebruiken voor een derde numerieke variabele, en facetten voor categorische variabelen. En dat is ongeveer de grens voordat de plots te moeilijk worden om te interpreteren. Er zijn specialistische plottypes, zoals correlatie-heatmaps en parallelle-coördinatenplots, die met meer variabelen overweg kunnen, maar die geven je veel minder informatie over elke variabele en zijn niet ideaal om modelvoorspellingen te visualiseren.
Hier ga je tot het uiterste met de scatterplot door de huizenprijs, de afstand tot het MRT-station, het aantal nabijgelegen gemakswinkels en de huizenleeftijd allemaal samen in één plot te laten zien.
taiwan_real_estate is beschikbaar.
Deze oefening maakt deel uit van de cursus
Gemiddelde regressie met statsmodels in Python
Oefeninstructies
- Maak een facetraster voor elke
house_age_yearsintaiwan_real_estate. - Gebruik de
taiwan_real_estate-gegevensset om een scatterplot te tekenen vann_conveniencetegenoversqrt_dist_to_mrt_m, ingekleurd op basis vanprice_twd_msq.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Prepare the grid using taiwan_real_estate, for each house age category, colored by price_twd_msq
grid = ____(data=____,
col=____,
hue=____,
palette="plasma")
# Plot the scatterplots with sqrt_dist_to_mrt_m on the x-axis and n_convenience on the y-axis
grid.map(____,
____,
____)
# Show the plot (brighter colors mean higher prices)
plt.show()