始める無料で始める

信用モデルのクロスバリデーション

クレジットローンとそのデータは時間とともに変化し、現在のテストセットに読み込まれているものと常に同じとは限りません。そこで、元の X_trainy_train から作られた、より小さな学習・テストセットを複数試すためにクロスバリデーションを使います。

XGBoost の関数 cv() を使ってクロスバリデーションを実行してください。テストデータで使うために、cv() のパラメータをすべて設定する必要があります。

ワークスペースにはデータセット X_trainy_train、学習済みモデル gbt、そして演習の読み込み時に表示されるパラメータ辞書 params が用意されています。

この演習はコースの一部です

Pythonで学ぶクレジットリスクモデリング

コースを見る

演習の手順

  • 分割数を 5、早期終了を 10 に設定し、それぞれ n_foldsearly_stopping として保存します。
  • 学習データを使って行列オブジェクト DTrain を作成します。
  • params、分割数、早期終了のオブジェクトを指定して cv() を実行し、結果を cv_df に保存します。
  • cv_df の中身を出力します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Set the values for number of folds and stopping iterations
____ = ____
____ = ____

# Create the DTrain matrix for XGBoost
____ = xgb.____(____, label = ____)

# Create the data frame of cross validations
____ = xgb.cv(____, ____, num_boost_round = 5, nfold=____,
            early_stopping_rounds=____)

# Print the cross validations data frame
____(____)
コードを編集して実行