延滞予測のための決定木
これからクレジットデータで勾配ブースティング木モデルを学習し、予測の一部を確認します。ロジスティック回帰モデルの予測を最初に見たときのことを覚えていますか?あまり良くありませんでした。今回は違う結果になると思いますか?
ワークスペースには、クレジットデータ cr_loan_prep、学習用の X_train と y_train、テストデータ X_test が用意されています。XGBoost パッケージは xgb として読み込まれています。
この演習はコースの一部です
Pythonで学ぶクレジットリスクモデリング
演習の手順
XGBClassifier()を使って勾配ブースティング木を作成・学習し、clf_gbtという名前を付けます。- テストデータに対して延滞(デフォルト)の確率を予測し、結果を
gbt_predsに保存します。 - 先頭5件の予測値と真の
loan_statusを保存するデータフレームpreds_dfとtrue_dfを作成します。 true_df、preds_dfの順に連結して出力し、モデルの結果を確認します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Train a model
import xgboost as xgb
____ = xgb.____().fit(____, np.ravel(____))
# Predict with a model
____ = clf_gbt.____(____)
# Create dataframes of first five predictions, and first five true labels
____ = pd.DataFrame(____[:,1][0:5], columns = ['prob_default'])
____ = y_test.____()
# Concatenate and print the two data frames for comparison
print(pd.____([____.reset_index(drop = True), ____], axis = 1))