Kom igångKom igång gratis

Flera variabler i en logistisk regressionsmodell

Tolkningen av en enskild parameter gäller även när du inkluderar flera variabler i en modell. När du anger flera variabler och vill tolka effekten av att en viss variabel förändras, förutsätts det att de övriga variablerna hålls konstanta. Det finns ett välkänt latinskt uttryck för detta: ceteris paribus, som bokstavligen betyder "allt annat lika".

För att bygga en logistisk regressionsmodell med flera variabler använder du +-tecknet för att lägga till variabler. Din formel ser ungefär ut så här:

y ~ x1 + ... + xk

När du utvärderar modellen finns det flera saker att ha i åtanke. Du har redan tittat på parametervärden, men det är inte det enda som spelar roll. Lika viktigt är den statistiska signifikansen hos ett visst parameterestimat. Signifikansen hos en parameter kallas ofta p-värde, men i modellens utdata visas den som Pr(>|t|). I glm markeras svag signifikans med "." och mycket stark signifikans med "***". Om en parameter inte är signifikant kan du inte säkerställa att den skiljer sig nämnvärt från 0. Statistisk signifikans är viktig – i allmänhet är det bara meningsfullt att tolka effekten på sannolikheten för fallissemang för signifikanta parametrar.

Den här övningen är en del av kursen

Kreditriskmodellering i R

Visa kurs

Övningsinstruktioner

  • Skapa en logistisk regressionsmodell med funktionen glm() och training_set. Inkludera variablerna age, ir_cat, grade, loan_amnt och annual_inc. Kalla modellen log_model_multi.
  • Hämta signifikansnivåerna med summary() i kombination med din modell. Du kommer att titta närmare på vad signifikansnivåer innebär i nästa övning!

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Build the logistic regression model



# Obtain significance levels using summary()
Redigera och kör kod