セクター別の総合統計量
前の章で学んだ各種の要約統計は、groupby オブジェクトに対して適用すると、カテゴリごとの結果を得ることができます。複数の指標を一度に確認できる .describe() も含まれます。
ここでは NASDAQ の上場銘柄で練習します。pandas は pd としてインポート済みで、NASDAQ の上場銘柄データは nasdaq という DataFrame としてワークスペースに用意されています。
この演習はコースの一部です
Pythonでの金融データのインポートと管理
演習の手順
.info()を使ってnasdaqデータの構造を確認します。- USD の時価総額を百万単位にした新しい列
market_cap_mを作成します。次の行で'Market Capitalization'列を削除します。 nasdaqデータを'Sector'でグループ化し、nasdaq_by_sectorに代入します。nasdaq_by_sectorに対して.describe()メソッドを呼び出し、summaryに代入して結果を出力します。- うまく動きますが、
resultはロング形式で、前に見たpd.MultiIndex()を使っています。.unstack()を呼び出してsummaryをワイド形式に変換します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Inspect NASDAQ data
nasdaq.____()
# Create market_cap_m
nasdaq['market_cap_m'] = ____[____].div(1e6)
# Drop the Market Capitalization column
nasdaq.drop('Market Capitalization', axis=1, inplace=True)
# Group nasdaq by Sector
nasdaq_by_sector = ____.____(____)
# Create summary statistics by sector
summary = ____.____()
# Print the summary
print(summary)
# Unstack
summary = ____.____()
# Print the summary again
print(summary)