学習用データとテスト用データへの分割
この章でも ANSUR データセットを使って作業を続けます。モデルを構築する前に、まず予測したい特徴量を決める必要があります。ここでは性別を予測します。
データセットからこの特徴量を含む列を取り出し、その後データを学習用とテスト用に分割します。学習用データはモデルの学習に、テスト用データは未知データでの性能確認に使います。
ansur_df はあらかじめ読み込まれています。
この演習はコースの一部です
Pythonで学ぶ次元削減
演習の手順
sklearn.model_selectionからtrain_test_split関数をインポートします。'Gender'列を y に代入します。- DataFrame から
'Gender'列を削除し、その結果をXに代入します。 - テストサイズを 30% に設定し、学習 70%/テスト 30% に分割します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Import train_test_split()
from ____.____ import ____
# Select the Gender column as the feature to be predicted (y)
y = ansur_df[____]
# Remove the Gender column to create the training data
X = ansur_df.____(____, ____)
# Perform a 70% train and 30% test data split
X_train, X_test, y_train, y_test = ____(X, y, ____=____)
print(f"{X_test.shape[0]} rows in test set vs. {X_train.shape[0]} in training set, {X_test.shape[1]} Features.")