Podstawy regresji logistycznej
W lekcji wideo analizowaliśmy model regresji logistycznej ze zmienną age jako predyktorem. Teraz użyjesz zmiennej kategorycznej i nauczysz się interpretować jej oszacowania parametrów.
Gdy do modelu regresji logistycznej w R dodasz zmienną kategoryczną, otrzymasz oszacowanie parametru dla wszystkich jej kategorii oprócz jednej. Kategoria, dla której nie ma oszacowania parametru, nazywana jest kategorią referencyjną. Parametr dla każdej z pozostałych kategorii reprezentuje iloraz szans na niewywiązanie się ze spłaty kredytu między daną kategorią a kategorią referencyjną. Nie martw się, jeśli na razie nie jest to do końca jasne – w kolejnych ćwiczeniach dokładniej zgłębisz ten temat!
To ćwiczenie jest częścią kursu
Modelowanie ryzyka kredytowego w R
Instrukcje do ćwiczenia
- Zbuduj model regresji logistycznej o nazwie
log_model_cat, używając zmiennej kategorycznejir_catjako jedynego predyktora. Wywołanie funkcji glm() powinno zawierać trzy argumenty: loan_status ~ ir_catfamily = "binomial"data = training_set- Wyświetl wynik w konsoli, aby zobaczyć oszacowania parametrów.
- Sprawdź, która kategoria jest kategorią referencyjną, analizując strukturę zmiennej
ir_cat(w pełnym zbiorze danychloan_data). Użyj do tego funkcjitable().
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Build a glm model with variable ir_cat as a predictor
# Print the parameter estimates
# Look at the different categories in ir_cat using table()