探索的データ分析(EDA)でデータを調べましょう
まず、データを探索してみましょう。機械学習(ML)プロジェクトを始める際は、最初に探索的データ分析(EDA)を行い、データへの理解を深めることが重要です。具体的には以下のような作業が含まれます。
- 生データのプロット
- ヒストグラム
- その他…
通常は生データのプロットとヒストグラムから始めます。これにより、データの分布を把握できます。正規分布であれば、パラメトリック統計などの手法を活用できます。
2つの銘柄データが pandas の DataFrame としてあらかじめ読み込まれています。lng_df(LNG)と spy_df(SPY)です。.head() で内容を確認しましょう。終値と、後々は出来高も ML アルゴリズムの入力として使用します。
注意:新しいプロットを作成するたびに plt.clf() を呼び出すか、f = plt.figure() を使用します。
この演習はコースの一部です
Python による金融のための Machine Learning
演習の手順
- 2つの DataFrame(
lng_dfとspy_df)の先頭5行を表示し、内容を確認しましょう。 - pandas ライブラリを使って、
'SPY'と'LNG'の調整後終値('Adj_Close')の生の時系列データをプロットしましょう。.plot()ではlegend=Trueを設定してください。 plt.show()を使って時系列プロットを表示しましょう(matplotlib.pyplotはpltとしてインポート済みです)。- pandas と matplotlib を使って、SPY と LNG の調整後終値における1日の価格変化率(
.pct_change()を使用)のヒストグラムを作成しましょう。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
print(lng_df.head()) # examine the DataFrames
print(____) # examine the SPY DataFrame
# Plot the Adj_Close columns for SPY and LNG
spy_df[____].plot(label='SPY', legend=True)
lng_df[____].plot(label=____, ____, secondary_y=True)
____ # show the plot
plt.clf() # clear the plot space
# Histogram of the daily price change percent of Adj_Close for LNG
lng_df['Adj_Close'].____.plot.hist(bins=50)
plt.xlabel('adjusted close 1-day percent change')
plt.show()