Obliczanie macierzy pomyłek
Macierz pomyłek (ang. confusion matrix, nazywana też tablicą pomyłek) stanowi podstawę wszystkich miar wydajności modeli z kategoryczną zmienną odpowiedzi (takich jak regresja logistyczna). Zawiera liczby wystąpień każdej kombinacji rzeczywistej i przewidywanej odpowiedzi. W tym przypadku, gdy możliwe są dwie odpowiedzi (odejście klienta lub jego brak), mamy cztery możliwe wyniki.
- Prawdziwie dodatni: Klient odszedł i model to przewidział.
- Fałszywie dodatni: Klient nie odszedł, ale model przewidział, że odejdzie.
- Prawdziwie ujemny: Klient nie odszedł i model to przewidział.
- Fałszywie ujemny: Klient odszedł, ale model przewidział, że nie odejdzie.
Dostępne są: churn oraz mdl_churn_vs_relationship.
To ćwiczenie jest częścią kursu
Wprowadzenie do regresji z użyciem statsmodels w Pythonie
Instrukcje do ćwiczenia
- Pobierz rzeczywiste odpowiedzi, wybierając kolumnę
has_churnedze zbioru danych. Przypisz wynik do zmiennejactual_response. - Pobierz z modelu „najbardziej prawdopodobne" przewidywane odpowiedzi. Przypisz wynik do zmiennej
predicted_response. - Utwórz DataFrame z
actual_responseipredicted_response. Przypisz wynik do zmiennejoutcomes. - Wyświetl
outcomesjako tabelę liczności reprezentującą macierz pomyłek. Ta część została już za ciebie napisana.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Get the actual responses
actual_response = ____
# Get the predicted responses
predicted_response = ____
# Create outcomes as a DataFrame of both Series
outcomes = pd.DataFrame({____,
____})
# Print the outcomes
print(outcomes.value_counts(sort = False))