AUC に基づくもう一段の剪定
動画では、ロジットリンクを用いた「フル」ロジスティック回帰モデルを、AUC に基づいて剪定していく様子を見ました。AUC が向上したため、home_ownership をモデルから削除しました。さらに同様の手順を2回繰り返し、age と ir_cat を削除した結果、次のモデルになりました。
log_3_remove_ir <- glm(loan_status ~ loan_amnt + grade + annual_inc + emp_cat, family = binomial, data = training_set)
このときの AUC は 0.6545 でした。ここからは、さらに別の変数を削除して AUC を改善できるかを確かめてみましょう。
この演習はコースの一部です
R で学ぶクレジットリスク・モデリング
演習の手順
- モデル
log_3_remove_irから一度に1変数ずつ削除してください。リンク関数はデフォルト(logit)を使います。 - 作成した各モデルについて、デフォルト確率の予測を行います。
- 各モデルの AUC を得るために、
auc()を使います。第1引数はtest_set$loan_status、第2引数は4つの各モデルの予測結果にします。 - 最も高い AUC を示したモデルを表すオブジェクト名(この演習の最初の設問で指定した名前のとおり)をコピーして提出してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Build four models each time deleting one variable in log_3_remove_ir
log_4_remove_amnt <- glm(loan_status ~ grade + annual_inc + emp_cat,
family = binomial, data = training_set)
log_4_remove_grade <-
log_4_remove_inc <-
log_4_remove_emp <-
# Make PD-predictions for each of the models
pred_4_remove_amnt <- predict(log_4_remove_amnt, newdata = test_set, type = "response")
pred_4_remove_grade <-
pred_4_remove_inc <-
pred_4_remove_emp <-
# Compute the AUCs