數值欄位的散佈矩陣
你已經初步查看新的農夫市集資料,這個資料相當「寬」——每個市集的列包含很多欄位。與其逐一比對每一組數值欄位並畫散佈圖來觀察相關性,不如改用 pandas 的內建函式建立散佈矩陣。
透過 figsize 參數放大圖表尺寸,可以讓這個密集的視覺化有更多留白。由於點之間會大量重疊,降低點的不透明度可以更清楚呈現重疊的密度。
本練習屬於課程
用 Python 改善你的資料視覺化
練習說明
- 將
marketsDataFrame 的欄位子集化為numeric_columns,讓散佈矩陣只顯示數值且非二元的欄位。 - 將圖尺寸增大為
15乘以10,以避免擁擠。 - 將點的不透明度降至 50%,以顯示重疊區域。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Select just the numeric columns (exluding individual goods)
numeric_columns = ['lat', 'lon', 'months_open', 'num_items_sold', 'state_pop']
# Make a scatter matrix of numeric columns
pd.plotting.scatter_matrix(markets[____],
# Make figure large to show details
figsize = ____,
# Lower point opacity to show overlap
alpha = ____)
plt.show()