Drzewa do przewidywania niespłacalności
Teraz wytrenuj model gradientowego drzewa wzmacnianego na danych kredytowych i sprawdź próbkę prognoz. Pamiętasz, gdy po raz pierwszy przeglądałeś predykcje modelu regresji logistycznej? Nie wyglądały zbyt dobrze. Czy ten model okaże się lepszy?
Dane kredytowe cr_loan_prep, zbiory treningowe X_train i y_train oraz dane testowe X_test są dostępne w środowisku pracy. Pakiet XGBoost jest załadowany jako xgb.
To ćwiczenie jest częścią kursu
Modelowanie ryzyka kredytowego w Pythonie
Instrukcje do ćwiczenia
- Utwórz i wytrenuj model gradientowego drzewa wzmacnianego, używając
XGBClassifier(), i nadaj mu nazwęclf_gbt. - Przewidź prawdopodobieństwa niespłacalności na danych testowych i zapisz wyniki w zmiennej
gbt_preds. - Utwórz dwie ramki danych –
preds_dfitrue_df– aby przechować pierwsze pięć predykcji oraz prawdziwe wartościloan_status. - Połącz i wyświetl ramki danych
true_dforazpreds_dfw tej kolejności, a następnie sprawdź wyniki modelu.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Train a model
import xgboost as xgb
____ = xgb.____().fit(____, np.ravel(____))
# Predict with a model
____ = clf_gbt.____(____)
# Create dataframes of first five predictions, and first five true labels
____ = pd.DataFrame(____[:,1][0:5], columns = ['prob_default'])
____ = y_test.____()
# Concatenate and print the two data frames for comparison
print(pd.____([____.reset_index(drop = True), ____], axis = 1))