Wizualizacja wielu zmiennych
Wraz z rosnącą liczbą zmiennych jednoczesne przedstawienie ich wszystkich na wykresie staje się coraz trudniejsze. Do dwóch zmiennych numerycznych możesz wykorzystać osie x i y, trzecią zmienną numeryczną możesz zakodować kolorem, a zmienne kategoryczne – fasetowaniem. To mniej więcej górna granica czytelności. Istnieją wyspecjalizowane typy wykresów, takie jak mapy ciepła korelacji czy wykresy współrzędnych równoległych, które radzą sobie z większą liczbą zmiennych – jednak dostarczają znacznie mniej informacji o każdej z nich i nie sprawdzają się najlepiej przy wizualizacji prognoz modelu.
W tym ćwiczeniu sprawdzisz, ile zmiennych możesz zmieścić na wykresie punktowym – przedstawisz jednocześnie cenę nieruchomości, odległość do stacji MRT, liczbę pobliskich sklepów oraz wiek budynku.
Zbiór danych taiwan_real_estate jest dostępny.
To ćwiczenie jest częścią kursu
Regresja średnio zaawansowana ze statsmodels w Pythonie
Instrukcje do ćwiczenia
- Utwórz siatkę fasetową dla każdej wartości
house_age_yearsze zbiorutaiwan_real_estate. - Korzystając ze zbioru danych
taiwan_real_estate, narysuj wykres punktowy zależnościn_convenienceodsqrt_dist_to_mrt_m, z kolorem zależnym odprice_twd_msq.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Prepare the grid using taiwan_real_estate, for each house age category, colored by price_twd_msq
grid = ____(data=____,
col=____,
hue=____,
palette="plasma")
# Plot the scatterplots with sqrt_dist_to_mrt_m on the x-axis and n_convenience on the y-axis
grid.map(____,
____,
____)
# Show the plot (brighter colors mean higher prices)
plt.show()