データを学習用とテスト用に分割する
回帰モデルの構築に進む前の最終ステップです!ここでは、目的変数と特徴量列の名前を特定し、データを抽出して、学習用とテスト用に分割します。
pandas と numpy ライブラリはそれぞれ pd、np として読み込まれています。入力特徴量は features データセットとしてインポートされており、前の演習で作成した目的変数は Y として用意されています。
この演習はコースの一部です
Pythonで学ぶマーケティングのための機械学習
演習の手順
- 顧客IDの列名をリストとして保存します。
- 顧客IDを除外して、特徴量の列名を選択します。
- 特徴量を
Xとして抽出します。 train_test_split()関数を使って、データを学習用とテスト用に分割します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Store customer identifier column name as a list
custid = ['___']
# Select feature column names excluding customer identifier
cols = [col for col in features.___ if col not in ___]
# Extract the features as `X`
X = features[___]
# Split data to training and testing
___, test_X, train_Y, ___ = ___(X, Y, test_size=0.25, random_state=99)