数値列の散布図行列
新しいファーマーズマーケットのデータを調べると、かなり横に広く、各マーケットの行に多くの列があることがわかりました。数値列のあらゆる組み合わせで相関を見るために逐一散布図を作るのではなく、pandasの組み込み関数を使って散布図行列を作成することにします。
figsize引数で図のサイズを大きくすると、密な可視化に余裕が生まれます。点が大きく重なり合うため、不透明度を下げることで重なりの密度を見やすくできます。
この演習はコースの一部です
Pythonでデータ可視化を磨く
演習の手順
- 散布図行列に数値の非二値列のみが表示されるよう、
marketsの列をnumeric_columnsにサブセットします。 - 混み合いを避けるため、図のサイズを横
15・縦10に拡大します。 - 重なりの領域を示すため、点の不透明度を50%に下げます。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Select just the numeric columns (exluding individual goods)
numeric_columns = ['lat', 'lon', 'months_open', 'num_items_sold', 'state_pop']
# Make a scatter matrix of numeric columns
pd.plotting.scatter_matrix(markets[____],
# Make figure large to show details
figsize = ____,
# Lower point opacity to show overlap
alpha = ____)
plt.show()