列重要性与违约预测
当使用包含多组列的多个训练集时,了解哪些列重要、哪些不重要非常关键。即使某些列对 loan_status 没有任何影响,维护它们也可能代价高或耗时长。
本练习的 X 数据由以下代码创建:
X = cr_loan_prep[['person_income','loan_int_rate',
'loan_percent_income','loan_amnt',
'person_home_ownership_MORTGAGE','loan_grade_F']]
在这些数据上训练一个 XGBClassifier() 模型,并检查列重要性,看看每一列对预测 loan_status 的作用如何。
cr_loan_pret 数据集以及 X_train 和 y_train 已加载到工作空间。
本练习是课程的一部分
Python 信用风险建模
练习说明
- 在
X_train和y_train训练集上创建并训练一个XGBClassifier()模型,并将其保存为clf_gbt。 - 使用
.get_booster()和.get_score()打印clf_gbt中各列的重要性。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create and train the model on the training data
____ = xgb.____().____(____,np.ravel(____))
# Print the column importances from the model
print(clf_gbt.____().____(importance_type = 'weight'))