列選択とモデル性能
列の組み合わせごとに学習用データを作成すると、モデルや各列の重要度に影響します。では、列の選び方が、precision と recall を組み合わせたモデルの F-1 スコアにも影響するでしょうか? この問いに答えるために、異なる列セットで2つのモデルを学習し、性能を確認してみましょう。
延滞(デフォルト)を非延滞と誤って予測すると、これらのローンのデフォルト確率が非常に低い場合でも想定外の損失につながるおそれがあります。延滞クラスの F-1 スコアを使って、モデルが延滞をどれだけ正確に予測できるかを確認できます。
クレジットデータ cr_loan_prep と、2つの学習用列セット X と X2 はワークスペースに読み込まれています。モデル gbt と gbt2 はすでに学習済みです。
この演習はコースの一部です
Pythonで学ぶクレジットリスクモデリング
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Predict the loan_status using each model
____ = gbt.____(____)
____ = gbt2.____(____)
# Print the classification report of the first model
target_names = ['Non-Default', 'Default']
print(____(____, ____, target_names=target_names))
# Print the classification report of the second model
print(____(____, ____, target_names=target_names))