시작하기무료로 시작하기

임계값이 성능에 미치는 영향

0.4로 임계값을 설정하면 모델 평가에서 고무적인 결과가 나타나요. 이제 precision_recall_fscore_support() 함수를 사용해 분류 리포트에서 선택한 기본값(연체) 재현율(recall)을 바탕으로 재무적 영향을 평가해 보세요.

이를 위해, 새 임계값으로 포착하지 못한 기본값이 어느 정도 비율인지 기본값 재현율을 사용해 파악한 뒤, 예상치 못한 손실 금액을 추정할 거예요. 이는 모든 미탐지 기본값이 한꺼번에 부도난다고 가정했을 때 발생할 손실 금액(달러)입니다.

평균 대출 금액 avg_loan_amnt는 미리 계산되어 있으며, preds_df, y_test와 함께 작업 공간에서 사용할 수 있어요.

이 연습은 강의의 일부입니다

Python으로 배우는 신용 리스크 모델링

강의 보기

연습 안내

  • 임계값 0.4를 사용하여 loan_status 값을 다시 지정하세요.
  • preds_df에서 값 빈도에서 두 번째 값을 선택해 기본값(연체) 개수를 구하고 num_defaults로 저장하세요.
  • 분류 행렬에서 기본값 재현율을 가져와 default_recall로 저장하세요.
  • 새로운 기본값 재현율을 사용해 예상치 못한 손실을 추정하세요. 계산은 1 - default_recall에 평균 대출 금액과 기본값 대출 건수를 곱하면 됩니다.

실습형 인터랙티브 연습

이 예제를 이 샘플 코드를 완성하여 풀어보세요.

# Reassign the values of loan status based on the new threshold
____[____] = ____[____].____(lambda x: 1 if x > ____ else 0)

# Store the number of loan defaults from the prediction data
____ = preds_df[____].____()[1]

# Store the default recall from the classification report
____ = ____(____,preds_df[____])[1][1]

# Calculate the estimated impact of the new default recall rate
print(____ * ____ * (1 - ____))
코드 편집 및 실행