Aan de slagBegin gratis

Veel variabelen visualiseren

Als je meer variabelen gaat bekijken, wordt het steeds lastiger om ze allemaal tegelijk te plotten. Naast het gebruik van x- en y-schalen voor twee numerieke variabelen, kun je kleur gebruiken voor een derde numerieke variabele, en facetten voor categorische variabelen. En dat is ongeveer de grens voordat de plots te moeilijk worden om te interpreteren. Er zijn specialistische plottypes, zoals correlatie-heatmaps en parallelle-coördinatenplots, die met meer variabelen overweg kunnen, maar die geven je veel minder informatie over elke variabele en zijn niet ideaal om modelvoorspellingen te visualiseren.

Hier ga je tot het uiterste met de scatterplot door de huizenprijs, de afstand tot het MRT-station, het aantal nabijgelegen gemakswinkels en de huizenleeftijd allemaal samen in één plot te laten zien.

taiwan_real_estate is beschikbaar.

Deze oefening maakt deel uit van de cursus

Gemiddelde regressie met statsmodels in Python

Bekijk cursus

Oefeninstructies

  • Maak een facetraster voor elke house_age_years in taiwan_real_estate.
  • Gebruik de taiwan_real_estate-gegevensset om een scatterplot te tekenen van n_convenience tegenover sqrt_dist_to_mrt_m, ingekleurd op basis van price_twd_msq.

Interactieve oefening met praktijkervaring

Probeer deze oefening door deze voorbeeldcode aan te vullen.

# Prepare the grid using taiwan_real_estate, for each house age category, colored by price_twd_msq
grid = ____(data=____,
            col=____,
            hue=____,
            palette="plasma")

# Plot the scatterplots with sqrt_dist_to_mrt_m on the x-axis and n_convenience on the y-axis
grid.map(____,
         ____,
         ____)

# Show the plot (brighter colors mean higher prices)
plt.show()
Code bewerken en uitvoeren