여러 변수를 시각화하기
변수가 늘어날수록 한 번에 모두를 그리는 일은 점점 더 어려워집니다. 두 개의 수치형 변수에는 x축과 y축을 쓰고, 세 번째 수치형 변수에는 색을, 범주형 변수에는 패싯을 활용할 수 있어요. 하지만 그 정도가 한계에 가깝고, 그 이상이 되면 그래프 해석이 매우 어려워집니다. 상관 행렬 히트맵이나 평행좌표 플롯 같은 특수한 그래프는 더 많은 변수를 다룰 수 있지만, 각 변수에 대한 정보는 훨씬 줄어들고, 모델 예측을 시각화하는 데도 적합하지 않습니다.
이번에는 산점도의 한계를 넓혀서, 주택 가격, MRT 역까지의 거리, 인근 편의점 수, 그리고 주택 연식을 하나의 플롯에서 모두 보여 보겠습니다.
taiwan_real_estate가 제공됩니다.
이 연습은 강의의 일부입니다
Python의 statsmodels로 배우는 중급 회귀
연습 안내
taiwan_real_estate에서house_age_years별 패싯 그리드를 만드세요.taiwan_real_estate데이터셋을 사용해,price_twd_msq로 색을 지정하여n_convenience대sqrt_dist_to_mrt_m산점도를 그리세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Prepare the grid using taiwan_real_estate, for each house age category, colored by price_twd_msq
grid = ____(data=____,
col=____,
hue=____,
palette="plasma")
# Plot the scatterplots with sqrt_dist_to_mrt_m on the x-axis and n_convenience on the y-axis
grid.map(____,
____,
____)
# Show the plot (brighter colors mean higher prices)
plt.show()