始める無料で始める

セクター別の総合統計量

前の章で学んだ各種の要約統計は、groupby オブジェクトに対して適用すると、カテゴリごとの結果を得ることができます。複数の指標を一度に確認できる .describe() も含まれます。

ここでは NASDAQ の上場銘柄で練習します。pandaspd としてインポート済みで、NASDAQ の上場銘柄データは nasdaq という DataFrame としてワークスペースに用意されています。

この演習はコースの一部です

Pythonでの金融データのインポートと管理

コースを見る

演習の手順

  • .info() を使って nasdaq データの構造を確認します。
  • USD の時価総額を百万単位にした新しい列 market_cap_m を作成します。次の行で 'Market Capitalization' 列を削除します。
  • nasdaq データを 'Sector' でグループ化し、nasdaq_by_sector に代入します。
  • nasdaq_by_sector に対して .describe() メソッドを呼び出し、summary に代入して結果を出力します。
  • うまく動きますが、result はロング形式で、前に見た pd.MultiIndex() を使っています。.unstack() を呼び出して summary をワイド形式に変換します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Inspect NASDAQ data
nasdaq.____()

# Create market_cap_m
nasdaq['market_cap_m'] = ____[____].div(1e6)

# Drop the Market Capitalization column
nasdaq.drop('Market Capitalization', axis=1, inplace=True)

# Group nasdaq by Sector
nasdaq_by_sector = ____.____(____)

# Create summary statistics by sector
summary = ____.____()

# Print the summary
print(summary)

# Unstack 
summary = ____.____()

# Print the summary again
print(summary)
コードを編集して実行