開始使用免費開始

數值欄位的散佈矩陣

你已經初步查看新的農夫市集資料,這個資料相當「寬」——每個市集的列包含很多欄位。與其逐一比對每一組數值欄位並畫散佈圖來觀察相關性,不如改用 pandas 的內建函式建立散佈矩陣。

透過 figsize 參數放大圖表尺寸,可以讓這個密集的視覺化有更多留白。由於點之間會大量重疊,降低點的不透明度可以更清楚呈現重疊的密度。

本練習屬於課程

用 Python 改善你的資料視覺化

檢視課程

練習說明

  • markets DataFrame 的欄位子集化為 numeric_columns,讓散佈矩陣只顯示數值且非二元的欄位。
  • 將圖尺寸增大為 15 乘以 10,以避免擁擠。
  • 將點的不透明度降至 50%,以顯示重疊區域。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Select just the numeric columns (exluding individual goods)
numeric_columns = ['lat', 'lon', 'months_open', 'num_items_sold', 'state_pop']

# Make a scatter matrix of numeric columns
pd.plotting.scatter_matrix(markets[____], 
                             # Make figure large to show details
                             figsize = ____, 
                           # Lower point opacity to show overlap
                           alpha = ____)

plt.show()
編輯並執行程式碼