Wiele zmiennych w modelu regresji logistycznej
Interpretacja pojedynczego parametru pozostaje taka sama, gdy do modelu dodajemy kolejne zmienne. Jeśli w modelu z wieloma zmiennymi chcemy zinterpretować wpływ jednej z nich, zakładamy, że pozostałe zmienne są stałe – niezmienione. Istnieje nawet łacińskie wyrażenie na to zjawisko: ceteris paribus, co dosłownie oznacza „przy pozostałych czynnikach niezmienionych".
Aby zbudować model regresji logistycznej z wieloma zmiennymi, użyj znaku + do ich dodawania. Formuła będzie wyglądać następująco:
y ~ x1 + ... + xk
Przy ocenie modelu warto zwrócić uwagę na kilka kwestii. Przyjrzałeś się już wartościom parametrów, ale to nie jedyna ważna informacja. Istotne jest również istotność statystyczna danego oszacowania parametru. Często jest ona opisywana jako p-wartość, choć w wynikach modelu znajdziesz ją pod oznaczeniem Pr(>|t|). W funkcji glm słaba istotność jest oznaczana symbolem ".", a bardzo silna – "***". Jeśli dany parametr nie jest istotny statystycznie, nie możesz być pewien, że różni się on istotnie od zera. Istotność statystyczna ma duże znaczenie – co do zasady interpretowanie wpływu na ryzyko niewywiązania się ze zobowiązań ma sens tylko dla parametrów istotnych statystycznie.
To ćwiczenie jest częścią kursu
Modelowanie ryzyka kredytowego w R
Instrukcje do ćwiczenia
- Utwórz model regresji logistycznej za pomocą funkcji
glm()i zbiorutraining_set. Uwzględnij zmienneage,ir_cat,grade,loan_amntiannual_inc. Nazwij ten modellog_model_multi. - Uzyskaj poziomy istotności, używając funkcji
summary()w połączeniu z tym modelem. W następnym ćwiczeniu dokładniej przyjrzysz się temu, co oznaczają poziomy istotności!
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Build the logistic regression model
# Obtain significance levels using summary()