Důležitost sloupců a výchozí predikce
Při práci s více trénovacími sadami obsahujícími různé skupiny sloupců je důležité sledovat, které sloupce mají vliv a které ne. Udržovat sadu sloupců, jež nemají žádný dopad na loan_status, může být nákladné i časově náročné.
Data X pro toto cvičení byla vytvořena následujícím kódem:
X = cr_loan_prep[['person_income','loan_int_rate',
'loan_percent_income','loan_amnt',
'person_home_ownership_MORTGAGE','loan_grade_F']]
Natrénuj model XGBClassifier() na těchto datech a zkontroluj důležitost jednotlivých sloupců – uvidíš, jak každý z nich přispívá k předpovídání loan_status.
Dataset cr_loan_pret spolu s X_train a y_train jsou již načteny v pracovním prostředí.
Toto cvičení je součástí kurzu
Credit Risk Modeling in Python
Pokyny k cvičení
- Vytvoř a natrénuj model
XGBClassifier()na trénovacích sadáchX_trainay_traina ulož ho jakoclf_gbt. - Vypiš důležitost sloupců modelu
clf_gbtpomocí.get_booster()a.get_score().
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Create and train the model on the training data
____ = xgb.____().____(____,np.ravel(____))
# Print the column importances from the model
print(clf_gbt.____().____(importance_type = 'weight'))