연체 분류 리포트
이제 모델 평가를 좀 더 자세히 살펴보겠습니다. 여기서는 연체 확률의 임계값을 설정해 분류 리포트를 통해 모델 성능을 분석하게 됩니다.
확률을 데이터 프레임으로 만들면 pandas의 기능을 모두 활용할 수 있어 다루기 쉬워집니다. 데이터에 임계값을 적용하고, loan_status 두 클래스에 대한 값의 개수를 확인해 각 클래스가 몇 건씩 예측되었는지 살펴보세요. 이렇게 하면 분류 리포트 점수를 해석하는 데 도움이 됩니다.
작업 공간에는 cr_loan_prep 데이터 세트, 학습된 로지스틱 회귀 clf_logistic, 실제 대출 상태 값 y_test, 그리고 예측 확률 preds가 로드되어 있습니다.
이 연습은 강의의 일부입니다
Python으로 배우는 신용 리스크 모델링
연습 안내
preds에서 연체 확률만으로 구성된 데이터 프레임을 만들고 이름을preds_df로 하세요.preds_df에서 연체 확률의 임계값0.50을 기준으로loan_status값을 다시 할당하세요.- 각
loan_status에 해당하는 행의 개수를 값의 개수로 출력하세요. y_test와preds_df를 사용해 분류 리포트를 출력하세요.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Create a dataframe for the probabilities of default
____ = pd.____(____[:,1], columns = ['prob_default'])
# Reassign loan status based on the threshold
____[____] = ____[____].apply(lambda x: 1 if x > ____ else 0)
# Print the row counts for each loan status
print(____[____].____())
# Print the classification report
target_names = ['Non-Default', 'Default']
print(____(____, ____['loan_status'], target_names=target_names))