データを学習用とテスト用に分割する
いくつかのシンプルな手順に沿って、いよいよエンドツーエンドのMachine Learningモデルを作成します。モデリングの細かなポイントは次の章で詳しく扱いますが、ここではまず重要なステップを実践して理解していきます。
独立変数は pandas のDataFrame X、従属変数は pandas のSeries Y として読み込まれています。
また、sklearn ライブラリから train_test_split 関数が読み込まれています。これから学習用データとテスト用データを作成し、正しく分割できたかを確認します。
この演習はコースの一部です
Pythonで学ぶマーケティングのための機械学習
演習の手順
XとYを、データの25%をテスト用にして学習用とテスト用に分割します。- 学習用データセットが元データの75%のみを含むことを確認します。
- テスト用データセットが元データの25%のみを含むことを確認します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Split X and Y into training and testing datasets
train_X, test_X, train_Y, test_Y = ___(___, ___, test_size=0.___)
# Ensure training dataset has only 75% of original X data
print(___.shape[0] / X.shape[0])
# Ensure testing dataset has only 25% of original X data
print(___.shape[0] / ___.shape[0])