KFold 交差検証
MLモデルを扱う際は、未知のデータに対する性能を適切に評価することが重要です。その代表的な手法が k-fold 交差検証です。この演習では、k-fold 交差検証がデータセットを学習用とテスト用にどのように分割するかを確認します。KFold と、心疾患データセットの特徴量 heart_disease_df_X はすでにインポートされています。
この演習はコースの一部です
End-to-End Machine Learning
演習の手順
n_splits=5、shuffle=True、random_state=42で KFold オブジェクトを作成しますkfold.split()を使ってデータを分割します- 学習用とテスト用の各分割に含まれるデータポイント数を出力します
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create a KFold object
kfold = ____(____, ____, ____)
# Get the train and test data from the first split from the shuffled KFold
train_data_split, test_data_split = next(____.____(____))
# Print out the number of datapoints in the train and test splits
print("Number of training datapoints in heart_disease_df_X:", ____)
print("Number of training datapoints in split:", ____)
print("Number of testing datapoints in split:", ____)