Zacznij terazZacznij za darmo

Wizualizacja wielu zmiennych objaśniających

Regresja logistyczna obsługuje również wiele zmiennych objaśniających. Wizualizacja napotyka tu podobne trudności co w przypadku regresji liniowej: im więcej zmiennych numerycznych, tym trudniej przedstawić je wszystkie na jednym wykresie. Przyjrzymy się sytuacji z dwiema numerycznymi zmiennymi objaśniającymi – rozwiązanie jest zasadniczo takie samo jak wcześniej: kolor służy do oznaczenia zmiennej odpowiedzi.

Zmienna odpowiedzi przyjmuje tu tylko dwie wartości: zero i jeden. Gdy do wykresu dodamy przewidywane odpowiedzi, wszystkie wartości będą się mieścić między zerem a jedynką. Najważniejsze jest wtedy określenie, czy przewidywania są bliskie zera, czy bliskie jedynki. Dlatego dwukolorowy gradient z punktem środkowym w 0,5 jest bardzo przydatny: odpowiedzi powyżej 0,5 mają jeden kolor, a poniżej 0,5 – drugi.

Zbiór danych dotyczący odejść klientów banku jest dostępny jako churn; biblioteka ggplot2 jest załadowana.

To ćwiczenie jest częścią kursu

Regresja średnio zaawansowana w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Korzystając ze zbioru danych churn, stwórz wykres przedstawiający czas od ostatniego zakupu (time_since_last_purchase) w zależności od długości relacji z klientem (time_since_first_purchase), z kolorowaniem według tego, czy klient zrezygnował z usług (has_churned).
  • Dodaj warstwę punktów z przezroczystością ustawioną na 0.5.
  • Użyj dwukolorowego gradientu z punktem środkowym 0.5.
  • Zastosuj czarno-białą motyw wykresu.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Using churn, plot recency vs. length of relationship colored by churn status
___ +
  # Make it a scatter plot, with transparency 0.5
  ___ +
  # Use a 2-color gradient split at 0.5
  ___ +
  # Use the black and white theme
  ___
Edytuj i uruchom kod