始める無料で始める

データを学習用とテスト用に分割する

回帰モデルの構築に進む前の最終ステップです!ここでは、目的変数と特徴量列の名前を特定し、データを抽出して、学習用とテスト用に分割します。

pandasnumpy ライブラリはそれぞれ pdnp として読み込まれています。入力特徴量は features データセットとしてインポートされており、前の演習で作成した目的変数は Y として用意されています。

この演習はコースの一部です

Pythonで学ぶマーケティングのための機械学習

コースを見る

演習の手順

  • 顧客IDの列名をリストとして保存します。
  • 顧客IDを除外して、特徴量の列名を選択します。
  • 特徴量を X として抽出します。
  • train_test_split() 関数を使って、データを学習用とテスト用に分割します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Store customer identifier column name as a list
custid = ['___']

# Select feature column names excluding customer identifier
cols = [col for col in features.___ if col not in ___]

# Extract the features as `X`
X = features[___]

# Split data to training and testing
___, test_X, train_Y, ___ = ___(X, Y, test_size=0.25, random_state=99)
コードを編集して実行