列の重要度と延滞(デフォルト)予測
多くの列グループを含む複数の訓練データを使う場合、どの列が重要で、どの列が重要でないかを把握しておくことが大切です。loan_status に影響しないのに列を維持し続けるのは、コストや時間がかかることがあります。
この演習の X データは次のコードで作成されています。
X = cr_loan_prep[['person_income','loan_int_rate',
'loan_percent_income','loan_amnt',
'person_home_ownership_MORTGAGE','loan_grade_F']]
このデータに対して XGBClassifier() モデルを学習し、列の重要度を確認して、各列が loan_status の予測にどの程度効いているかを確かめてください。
cr_loan_pret データセットと X_train、y_train はワークスペースに読み込まれています。
この演習はコースの一部です
Pythonで学ぶクレジットリスクモデリング
演習の手順
X_trainとy_trainの訓練データでXGBClassifier()モデルを作成・学習し、clf_gbtとして保存します。.get_booster()と.get_score()を使って、clf_gbtの列に対する重要度を表示します。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
# Create and train the model on the training data
____ = xgb.____().____(____,np.ravel(____))
# Print the column importances from the model
print(clf_gbt.____().____(importance_type = 'weight'))