scikit-learn の KFold()
同僚のコードを実行して、ランダムフォレストモデルを作成し、サンプル外の精度を計算したところです。ところが、そのコードには random state が設定されておらず、あなたが得た誤差は同僚が報告したものとまったく異なっていました。
このランダムフォレストモデルが新しいデータでどれくらい正確に予測できるかをより適切に見積もるため、KFold クロスバリデーションで使用するインデックスを生成することにしました。
この演習はコースの一部です
Python によるモデル検証
演習の手順
KFold()を呼び出し、分割数を 5、シャッフルあり、random_state を 1111 にしてデータを分割できるように設定してください。KFoldのsplit()メソッドをXに対して実行してください。- 訓練用インデックスと検証用インデックスのそれぞれに含まれるインデックス数を出力してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
from sklearn.model_selection import KFold
# Use KFold
kf = KFold(____, ____, ____)
# Create splits
splits = kf.____(____)
# Print the number of indices
for train_index, val_index in splits:
print("Number of training indices: %s" % len(____))
print("Number of validation indices: %s" % len(____))