始める無料で始める

アンダーサンプリング後のツリーの性能

学習データをアンダーサンプリングし、そのデータでモデルを学習しました。

モデルの予測性能は、テストセットでのデフォルト確率に影響するだけでなく、今後入ってくる新規ローン申請のスコアリングにも影響します。さらに、デフォルトを見逃さない(高い再現率を保つ)ことがより重要であると分かりました。デフォルトを非デフォルトと誤分類すると、コストが大きくなるためです。

次に重要なステップは、新しいモデルの性能を元のモデルと比較することです。元の予測は gbt_preds に、新しいモデルの予測は gbt2_preds に保存されています。

gbt_predsgbt2_preds のモデル予測に加えて、y_test もワークスペースに用意されています。

この演習はコースの一部です

Pythonで学ぶクレジットリスクモデリング

コースを見る

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Check the classification reports
target_names = ['Non-Default', 'Default']
print(____(y_test, ____, target_names=target_names))
print(____(y_test, ____, target_names=target_names))
コードを編集して実行