勾配ブースティングによるポートフォリオのパフォーマンス
ここまでで、LogisticRegression() と XGBClassifier() の両方を使って延滞確率(probability of default)を予測しました。スコアリングや予測のサンプルも確認しましたが、ポートフォリオ全体のパフォーマンスにはどのように影響するのでしょうか? モデルを変えて検証する重要性を、期待損失(expected loss)を用いたシナリオで示してみましょう。
portfolio というデータフレームには、両モデルの延滞確率、デフォルト時損失率(いまは20%と仮定)、そしてデフォルト時エクスポージャとして扱う loan_amnt がまとめられています。
ワークスペースには、データフレーム cr_loan_prep に加えて、学習用の X_train と y_train が読み込まれています。
この演習はコースの一部です
Pythonで学ぶクレジットリスクモデリング
演習の手順
portfolioの最初の5行を出力します。gbtモデルとlrモデルのexpected_loss列を作成し、それぞれgbt_expected_lossとlr_expected_lossと名付けます。- ポートフォリオ全体の
lr_expected_lossの合計を出力します。 - ポートフォリオ全体の
gbt_expected_lossの合計を出力します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Print the first five rows of the portfolio data frame
print(____.____())
# Create expected loss columns for each model using the formula
portfolio[____] = portfolio[____] * portfolio[____] * portfolio[____]
portfolio[____] = portfolio[____] * portfolio[____] * portfolio[____]
# Print the sum of the expected loss for lr
print('LR expected loss: ', np.____(____[____]))
# Print the sum of the expected loss for gbt
print('GBT expected loss: ', np.____(____[____]))