Importanța coloanelor și predicția implicită
Când lucrezi cu mai multe seturi de antrenament care conțin grupuri diferite de coloane, este important să urmărești care coloane contează și care nu. Menținerea unor coloane poate fi costisitoare sau consumatoare de timp, mai ales dacă acestea nu au niciun impact asupra loan_status.
Datele X pentru acest exercițiu au fost create cu următorul cod:
X = cr_loan_prep[['person_income','loan_int_rate',
'loan_percent_income','loan_amnt',
'person_home_ownership_MORTGAGE','loan_grade_F']]
Antrenează un model XGBClassifier() pe aceste date și verifică importanța coloanelor pentru a vedea cum contribuie fiecare la predicția variabilei loan_status.
Setul de date cr_loan_pret, împreună cu X_train și y_train, au fost încărcate în spațiul de lucru.
Acest exercițiu face parte din cursul
Modelarea Riscului de Credit în Python
Instrucțiuni pentru exercițiu
- Creează și antrenează un model
XGBClassifier()pe seturile de antrenamentX_trainșiy_train, apoi stochează-l caclf_gbt. - Afișează importanța coloanelor pentru
clf_gbtfolosind.get_booster()și.get_score().
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Create and train the model on the training data
____ = xgb.____().____(____,np.ravel(____))
# Print the column importances from the model
print(clf_gbt.____().____(importance_type = 'weight'))