Confusion matrix
Als de responsvariabele slechts twee uitkomsten heeft, zoals bij churn, draait het bij het beoordelen van het model om: "hoeveel gevallen waarin de klant churnde voorspelde het model correct?" en "hoeveel gevallen waarin de klant niet churnde voorspelde het model correct?". Dit kun je vinden door een confusion matrix te maken en er samenvattende statistieken van te berekenen.
Herinner je de volgende definities:
Accuracy is het aandeel voorspellingen dat correct is. $$ \text{accuracy} = \frac{TN + TP}{TN + FN + FP + TP} $$
Sensitivity is het aandeel ware observaties dat door het model correct als waar wordt voorspeld. $$ \text{sensitivity} = \frac{TP}{TP + FN} $$
Specificity is het aandeel valse observaties dat door het model correct als vals wordt voorspeld. $$ \text{specificity} = \frac{TN}{TN + FP} $$
churn en mdl_churn_vs_both_inter zijn beschikbaar.
Deze oefening maakt deel uit van de cursus
Gemiddelde regressie met statsmodels in Python
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Create conf_matrix
conf_matrix = ____
# Print it
print(conf_matrix)