始める無料で始める

学習用データとテスト用データへの分割

この章でも ANSUR データセットを使って作業を続けます。モデルを構築する前に、まず予測したい特徴量を決める必要があります。ここでは性別を予測します。

データセットからこの特徴量を含む列を取り出し、その後データを学習用とテスト用に分割します。学習用データはモデルの学習に、テスト用データは未知データでの性能確認に使います。

ansur_df はあらかじめ読み込まれています。

この演習はコースの一部です

Pythonで学ぶ次元削減

コースを見る

演習の手順

  • sklearn.model_selection から train_test_split 関数をインポートします。
  • 'Gender' 列を y に代入します。
  • DataFrame から 'Gender' 列を削除し、その結果を X に代入します。
  • テストサイズを 30% に設定し、学習 70%/テスト 30% に分割します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Import train_test_split()
from ____.____ import ____

# Select the Gender column as the feature to be predicted (y)
y = ansur_df[____]

# Remove the Gender column to create the training data
X = ansur_df.____(____, ____)

# Perform a 70% train and 30% test data split
X_train, X_test, y_train, y_test = ____(X, y, ____=____)

print(f"{X_test.shape[0]} rows in test set vs. {X_train.shape[0]} in training set, {X_test.shape[1]} Features.")
コードを編集して実行