연체 예측을 위한 트리
이제 신용 데이터에 대해 Gradient Boosted Tree 모델을 학습하고, 예측 결과 일부를 살펴보겠습니다. 로지스틱 회귀 모델의 예측을 처음 봤을 때를 기억하시나요? 썩 좋아 보이진 않았죠. 이번 모델은 다를까요?
워크스페이스에는 신용 데이터 cr_loan_prep, 학습용 X_train과 y_train, 테스트 데이터 X_test가 준비되어 있어요. XGBoost 패키지는 xgb로 불러와져 있습니다.
이 연습은 강의의 일부입니다
Python으로 배우는 신용 리스크 모델링
연습 안내
XGBClassifier()로 Gradient Boosted Tree를 생성해 학습하고, 이름을clf_gbt로 지정하세요.- 테스트 데이터에 대해 연체(default) 확률을 예측해 결과를
gbt_preds에 저장하세요. - 처음 다섯 개 예측과 실제
loan_status값을 저장할 데이터 프레임preds_df와true_df를 각각 생성하세요. true_df와preds_df를 이 순서대로 이어 붙여 출력하고, 모델 결과를 확인하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Train a model
import xgboost as xgb
____ = xgb.____().fit(____, np.ravel(____))
# Predict with a model
____ = clf_gbt.____(____)
# Create dataframes of first five predictions, and first five true labels
____ = pd.DataFrame(____[:,1][0:5], columns = ['prob_default'])
____ = y_test.____()
# Concatenate and print the two data frames for comparison
print(pd.____([____.reset_index(drop = True), ____], axis = 1))