始める無料で始める

延滞予測のための決定木

これからクレジットデータで勾配ブースティング木モデルを学習し、予測の一部を確認します。ロジスティック回帰モデルの予測を最初に見たときのことを覚えていますか?あまり良くありませんでした。今回は違う結果になると思いますか?

ワークスペースには、クレジットデータ cr_loan_prep、学習用の X_trainy_train、テストデータ X_test が用意されています。XGBoost パッケージは xgb として読み込まれています。

この演習はコースの一部です

Pythonで学ぶクレジットリスクモデリング

コースを見る

演習の手順

  • XGBClassifier() を使って勾配ブースティング木を作成・学習し、clf_gbt という名前を付けます。
  • テストデータに対して延滞(デフォルト)の確率を予測し、結果を gbt_preds に保存します。
  • 先頭5件の予測値と真の loan_status を保存するデータフレーム preds_dftrue_df を作成します。
  • true_dfpreds_df の順に連結して出力し、モデルの結果を確認します。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

# Train a model
import xgboost as xgb
____ = xgb.____().fit(____, np.ravel(____))

# Predict with a model
____ = clf_gbt.____(____)

# Create dataframes of first five predictions, and first five true labels
____ = pd.DataFrame(____[:,1][0:5], columns = ['prob_default'])
____ = y_test.____()

# Concatenate and print the two data frames for comparison
print(pd.____([____.reset_index(drop = True), ____], axis = 1))
コードを編集して実行