혼동 행렬 계산하기
혼동 행렬(때로는 혼동 표라고도 함)은 범주형 반응 변수를 갖는 모델(예: 로지스틱 회귀)의 모든 성능 지표의 기반이 됩니다. 여기에는 실제 반응과 예측 반응의 각 조합에 대한 개수가 담겨 있습니다. 이 예시처럼 가능한 반응이 두 가지(이탈 또는 비이탈)인 경우, 총 네 가지 결과가 생깁니다.
- True positive: 고객이 실제로 이탈했고, 모델도 이탈로 예측했어요.
- False positive: 고객은 이탈하지 않았지만, 모델은 이탈로 예측했어요.
- True negative: 고객이 실제로 이탈하지 않았고, 모델도 비이탈로 예측했어요.
- False negative: 고객이 실제로 이탈했지만, 모델은 비이탈로 예측했어요.
churn와 mdl_churn_vs_relationship가 준비되어 있습니다.
이 연습은 강의의 일부입니다
Python에서 statsmodels로 살펴보는 회귀 소개
연습 안내
- 데이터셋의
has_churned열을 서브셋팅해 실제 반응을 구하고actual_response에 할당하세요. - 모델에서 "가장 가능성이 높은" 예측 반응을 구하고
predicted_response에 할당하세요. actual_response와predicted_response로부터 DataFrame을 만들고outcomes에 할당하세요.- 혼동 행렬을 나타내도록
outcomes를 빈도 표로 출력하세요. 이 항목은 미리 작성되어 있습니다.
실습형 인터랙티브 연습
이 예제를 이 샘플 코드를 완성하여 풀어보세요.
# Get the actual responses
actual_response = ____
# Get the predicted responses
predicted_response = ____
# Create outcomes as a DataFrame of both Series
outcomes = pd.DataFrame({____,
____})
# Print the outcomes
print(outcomes.value_counts(sort = False))