언더샘플링 직관
직관을 다시 점검해 봅시다! 이제 학습 세트를 언더샘플링해 연체 예측을 개선하는 효과를 보셨죠. 학습 데이터셋 X_train을 언더샘플링했고, 새 모델의 AUC 점수와 연체에 대한 재현율이 향상되었습니다. 학습 데이터에는 클래스 불균형이 있었고, 이는 대부분의 신용 대출 데이터에서 정상적입니다.
테스트 데이터 X_test는 언더샘플링하지 않았습니다. 왜 테스트 세트도 언더샘플링하지 않았을까요?
이 연습은 강의의 일부입니다
