始める無料で始める

探索的データ分析(EDA)でデータを調べましょう

まず、データを探索してみましょう。機械学習(ML)プロジェクトを始める際は、最初に探索的データ分析(EDA)を行い、データへの理解を深めることが重要です。具体的には以下のような作業が含まれます。

  • 生データのプロット
  • ヒストグラム
  • その他…

通常は生データのプロットとヒストグラムから始めます。これにより、データの分布を把握できます。正規分布であれば、パラメトリック統計などの手法を活用できます。

2つの銘柄データが pandas の DataFrame としてあらかじめ読み込まれています。lng_df(LNG)と spy_df(SPY)です。.head() で内容を確認しましょう。終値と、後々は出来高も ML アルゴリズムの入力として使用します。

注意:新しいプロットを作成するたびに plt.clf() を呼び出すか、f = plt.figure() を使用します。

この演習はコースの一部です

Python による金融のための Machine Learning

コースを見る

演習の手順

  • 2つの DataFrame(lng_dfspy_df)の先頭5行を表示し、内容を確認しましょう。
  • pandas ライブラリを使って、'SPY''LNG' の調整後終値('Adj_Close')の生の時系列データをプロットしましょう。.plot() では legend=True を設定してください。
  • plt.show() を使って時系列プロットを表示しましょう(matplotlib.pyplotplt としてインポート済みです)。
  • pandas と matplotlib を使って、SPY と LNG の調整後終値における1日の価格変化率(.pct_change() を使用)のヒストグラムを作成しましょう。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

print(lng_df.head())  # examine the DataFrames
print(____)  # examine the SPY DataFrame

# Plot the Adj_Close columns for SPY and LNG
spy_df[____].plot(label='SPY', legend=True)
lng_df[____].plot(label=____, ____, secondary_y=True)
____  # show the plot
plt.clf()  # clear the plot space

# Histogram of the daily price change percent of Adj_Close for LNG
lng_df['Adj_Close'].____.plot.hist(bins=50)
plt.xlabel('adjusted close 1-day percent change')
plt.show()
コードを編集して実行