Více proměnných v logistickém regresním modelu
Interpretace jednoho parametru zůstává stejná i tehdy, když do modelu zahrneme více proměnných. Pokud chceš zjistit, jak se změní výsledek při změně určité proměnné, předpokládá se, že ostatní proměnné zůstávají konstantní. Pro tento princip existuje elegantní latinský výraz – ceteris paribus, doslova „za jinak stejných podmínek".
Pro sestavení logistického regresního modelu s více proměnnými je stačí spojit znaménkem +. Vzorec pak bude vypadat přibližně takto:
y ~ x1 + ... + xk
Při vyhodnocování modelu je potřeba mít na paměti několik věcí. Hodnoty parametrů jsou důležité, ale zdaleka ne jediné, na co se zaměřit. Neméně důležitá je statistická významnost odhadů jednotlivých parametrů. Ta se vyjadřuje pomocí p-hodnoty, v výstupu modelu ji najdeš pod označením Pr(>|t|). Ve výstupu funkce glm se slabá významnost označuje tečkou ".", silná pak hvězdičkami "***". Pokud parametr není statisticky významný, nelze tvrdit, že se jeho hodnota významně liší od 0. Statistická významnost je zásadní – interpretovat vliv na pravděpodobnost selhání dává smysl zpravidla jen u statisticky významných parametrů.
Toto cvičení je součástí kurzu
Modelování kreditního rizika v R
Pokyny k cvičení
- Pomocí funkce
glm()a datové sadytraining_setvytvoř logistický regresní model. Zahrň proměnnéage,ir_cat,grade,loan_amntaannual_inc. Model pojmenujlog_model_multi. - Pomocí funkce
summary()aplikované na tento model zjisti úrovně statistické významnosti. V příští úloze se na jejich interpretaci podíváme podrobněji!
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Build the logistic regression model
# Obtain significance levels using summary()