始める無料で始める

データを学習用とテスト用に分割する

いくつかのシンプルな手順に沿って、いよいよエンドツーエンドのMachine Learningモデルを作成します。モデリングの細かなポイントは次の章で詳しく扱いますが、ここではまず重要なステップを実践して理解していきます。

独立変数は pandas のDataFrame X、従属変数は pandas のSeries Y として読み込まれています。

また、sklearn ライブラリから train_test_split 関数が読み込まれています。これから学習用データとテスト用データを作成し、正しく分割できたかを確認します。

この演習はコースの一部です

Pythonで学ぶマーケティングのための機械学習

コースを見る

演習の手順

  • XY を、データの25%をテスト用にして学習用とテスト用に分割します。
  • 学習用データセットが元データの75%のみを含むことを確認します。
  • テスト用データセットが元データの25%のみを含むことを確認します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Split X and Y into training and testing datasets
train_X, test_X, train_Y, test_Y = ___(___, ___, test_size=0.___)

# Ensure training dataset has only 75% of original X data
print(___.shape[0] / X.shape[0])

# Ensure testing dataset has only 25% of original X data
print(___.shape[0] / ___.shape[0])
コードを編集して実行