Важность признаков и прогноз по умолчанию
Когда вы работаете с несколькими обучающими наборами, включающими разные группы столбцов, важно следить за тем, какие из них действительно влияют на результат, а какие — нет. Поддерживать столбцы, которые не оказывают никакого влияния на loan_status, может быть затратно и по времени, и по ресурсам.
Данные X для этого упражнения сформированы следующим кодом:
X = cr_loan_prep[['person_income','loan_int_rate',
'loan_percent_income','loan_amnt',
'person_home_ownership_MORTGAGE','loan_grade_F']]
Обучите модель XGBClassifier() на этих данных и проверьте важность столбцов, чтобы понять, как каждый из них влияет на предсказание loan_status.
Набор данных cr_loan_pret, а также X_train и y_train уже загружены в рабочую среду.
Это упражнение является частью курса
Моделирование кредитного риска на Python
Инструкции к упражнению
- Создайте и обучите модель
XGBClassifier()на обучающих наборахX_trainиy_train, сохранив её в переменнуюclf_gbt. - Выведите значения важности столбцов для модели
clf_gbt, используя методы.get_booster()и.get_score().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create and train the model on the training data
____ = xgb.____().____(____,np.ravel(____))
# Print the column importances from the model
print(clf_gbt.____().____(importance_type = 'weight'))