混淆矩陣
當應變數只有兩種結果時(例如是否流失),評估模型表現的重點在於:「模型正確預測了多少個實際流失的案例?」以及「模型正確預測了多少個實際未流失的案例?」。你可以透過建立混淆矩陣,並在其上計算摘要指標來得到這些資訊。
回顧以下定義:
「Accuracy(準確率)」是所有預測中,正確者所佔的比例。 $$ \text{accuracy} = \frac{TN + TP}{TN + FN + FP + TP} $$
「Sensitivity(敏感度,也稱召回率/真正率)」是所有「真」的觀測中,被模型正確預測為「真」的比例。 $$ \text{sensitivity} = \frac{TP}{TP + FN} $$
「Specificity(特異度)」是所有「假」的觀測中,被模型正確預測為「假」的比例。 $$ \text{specificity} = \frac{TN}{TN + FP} $$
churn 和 mdl_churn_vs_both_inter 已可使用。
本練習屬於課程
使用 Python 的 statsmodels 進行迴歸分析:中級
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create conf_matrix
conf_matrix = ____
# Print it
print(conf_matrix)