Einfache logistische Regression
Im Video hast du dir ein logistisches Regressionsmodell mit der Variable age als Prädiktor angeschaut. Jetzt nimmst du eine kategoriale Variable dazu und lernst, wie du ihre Parameterschätzungen interpretierst.
Wenn du in R eine kategoriale Variable in ein logistisches Regressionsmodell aufnimmst, erhältst du für alle, bis auf eine, ihrer Kategorien eine Parameterschätzung. Die Kategorie, für die keine Schätzung angegeben wird, heißt die Referenzkategorie. Der Parameter für jede andere Kategorie steht für das Odds Ratio zugunsten eines Kreditausfalls zwischen der betreffenden Kategorie und der Referenzkategorie. Keine Sorge, wenn das noch nicht völlig klar ist — du wirst später noch weitere Übungen dazu machen!
Diese Übung ist Teil des Kurses
<Kurs>Kreditrisikomodellierung in R</Kurs>Übungsanweisungen
- Erstelle ein logistisches Regressionsmodell namens
log_model_catmit der kategorialen Variablenir_catals einzigem Prädiktor. Dein Aufruf von glm() sollte drei Argumente enthalten: loan_status ~ ir_catfamily = "binomial"data = training_set- Schau dir das Ergebnis in der Konsole an, um die Parameterschätzungen zu sehen.
- Finde heraus, welche die Referenzkategorie ist, indem du dir die Struktur von
ir_cat(im vollständigen Datensatzloan_data) nochmal anschaust. Verwende dazu die Funktiontable().
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Build a glm model with variable ir_cat as a predictor
# Print the parameter estimates
# Look at the different categories in ir_cat using table()