Arbori pentru predicția nerambursărilor
Acum vei antrena un model de arbori cu gradient boosting pe datele de credit și vei examina câteva dintre predicții. Îți amintești când ai văzut primele predicții ale modelului de regresie logistică? Nu arătau prea bine. Crezi că acest model va fi diferit?
Dataele de credit cr_loan_prep, seturile de antrenament X_train și y_train, precum și datele de testare X_test sunt disponibile în spațiul de lucru. Pachetul XGBoost este încărcat ca xgb.
Acest exercițiu face parte din cursul
Modelarea Riscului de Credit în Python
Instrucțiuni pentru exercițiu
- Creează și antrenează un arbore cu gradient boosting folosind
XGBClassifier()și denumește-lclf_gbt. - Prezice probabilitățile de nerambursare pe datele de testare și stochează rezultatele în
gbt_preds. - Creează două cadre de date,
preds_dfșitrue_df, pentru a stoca primele cinci predicții și valorile reale aleloan_status. - Concatenează și afișează cadrele de date
true_dfșipreds_dfîn această ordine, apoi verifică rezultatele modelului.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Train a model
import xgboost as xgb
____ = xgb.____().fit(____, np.ravel(____))
# Predict with a model
____ = clf_gbt.____(____)
# Create dataframes of first five predictions, and first five true labels
____ = pd.DataFrame(____[:,1][0:5], columns = ['prob_default'])
____ = y_test.____()
# Concatenate and print the two data frames for comparison
print(pd.____([____.reset_index(drop = True), ____], axis = 1))