数值列的散点矩阵
您已经查看了新的农贸市场数据,表格相当"宽"——每一行市场都有很多信息列。与其逐一遍历每种数值列组合并绘制散点图来观察相关性,不如使用 pandas 的内置函数来生成散点矩阵。
通过 figsize 参数增大图像尺寸,可以让这张信息密集的可视化更"透气"。由于点之间会有大量重叠,降低点的不透明度有助于呈现这些重叠区域的密度。
本练习是课程的一部分
用 Python 提升数据可视化
练习说明
- 将
marketsDataFrame 的列子集化为numeric_columns,使散点矩阵只显示数值型的非二元列。 - 将图像尺寸增大到
15×10,以避免拥挤。 - 将点的不透明度降低到 50%,以显示重叠区域。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Select just the numeric columns (exluding individual goods)
numeric_columns = ['lat', 'lon', 'months_open', 'num_items_sold', 'state_pop']
# Make a scatter matrix of numeric columns
pd.plotting.scatter_matrix(markets[____],
# Make figure large to show details
figsize = ____,
# Lower point opacity to show overlap
alpha = ____)
plt.show()