Stromy pro předpověď nesplácení
Teď natrénuješ model gradientně posílených stromů na úvěrových datech a prohlédneš si ukázku predikcí. Pamatuješ si, jak vypadaly první predikce logistické regrese? Moc dobře nedopadly. Myslíš, že tento model bude jiný?
V pracovním prostředí máš k dispozici úvěrová data cr_loan_prep, trénovací sady X_train a y_train a testovací data X_test. Balíček XGBoost je načtený pod názvem xgb.
Toto cvičení je součástí kurzu
Credit Risk Modeling in Python
Pokyny k cvičení
- Vytvoř a natrénuj model gradientně posílených stromů pomocí
XGBClassifier()a pojmenuj hoclf_gbt. - Predikuj pravděpodobnosti nesplácení na testovacích datech a výsledky ulož do
gbt_preds. - Vytvoř dva datové rámce,
preds_dfatrue_df, pro uložení prvních pěti predikcí a skutečných hodnotloan_status. - Spoj datové rámce
true_dfapreds_dfv tomto pořadí, vypiš je a zkontroluj výsledky modelu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Train a model
import xgboost as xgb
____ = xgb.____().fit(____, np.ravel(____))
# Predict with a model
____ = clf_gbt.____(____)
# Create dataframes of first five predictions, and first five true labels
____ = pd.DataFrame(____[:,1][0:5], columns = ['prob_default'])
____ = y_test.____()
# Concatenate and print the two data frames for comparison
print(pd.____([____.reset_index(drop = True), ____], axis = 1))