Viele Variablen visualisieren
Wenn du mehr Variablen betrachtest, wird es immer schwieriger, sie alle gleichzeitig zu plotten. Zusätzlich zu x- und y-Achsen für zwei numerische Variablen kannst du Farbe für eine dritte numerische Variable verwenden und Faceting für kategoriale Variablen. Und damit ist die Grenze fast erreicht, bevor die Plots zu schwer zu interpretieren werden. Es gibt Spezialdiagramme wie Korrelations-Heatmaps und Parallelkoordinaten, die mit mehr Variablen umgehen können, aber sie liefern deutlich weniger Informationen über jede einzelne Variable und eignen sich nicht gut, um Modellvorhersagen zu visualisieren.
Hier reizt du die Möglichkeiten des Streudiagramms aus, indem du den Hauspreis, die Entfernung zur MRT-Station, die Anzahl der nahegelegenen Convenience Stores und das Hausalter gemeinsam in einem Plot darstellst.
taiwan_real_estate ist verfügbar.
Diese Übung ist Teil des Kurses
<Kurs>Fortgeschrittene Regression mit statsmodels in Python</Kurs>Übungsanweisungen
- Erzeuge ein Facet Grid für jedes
house_age_yearsintaiwan_real_estate. - Zeichne mit dem Datensatz
taiwan_real_estateein Streudiagramm vonn_conveniencegegensqrt_dist_to_mrt_m, eingefärbt nachprice_twd_msq.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Prepare the grid using taiwan_real_estate, for each house age category, colored by price_twd_msq
grid = ____(data=____,
col=____,
hue=____,
palette="plasma")
# Plot the scatterplots with sqrt_dist_to_mrt_m on the x-axis and n_convenience on the y-axis
grid.map(____,
____,
____)
# Show the plot (brighter colors mean higher prices)
plt.show()