Grundläggande logistisk regression
I videon tittade vi på en logistisk regressionsmodell med variabeln age som prediktor. Nu ska du inkludera en kategorisk variabel och lära dig att tolka dess parameterestimat.
När du inkluderar en kategorisk variabel i en logistisk regressionsmodell i R får du ett parameterestimat för alla kategorier utom en. Den kategori som inte får något parameterestimat kallas referenskategori. Parametern för var och en av de övriga kategorierna representerar oddskvoten för kreditförlust mellan den aktuella kategorin och referenskategorin. Oroa dig inte om det inte känns helt klart än – du kommer att öva mer på det här längre fram!
Den här övningen är en del av kursen
Kreditriskmodellering i R
Övningsinstruktioner
- Bygg en logistisk regressionsmodell med namnet
log_model_catdär den kategoriska variabelnir_catär den enda prediktorn. Ditt anrop till glm() ska innehålla tre argument: loan_status ~ ir_catfamily = "binomial"data = training_set- Visa resultatet i konsolen för att se dina parameterestimat.
- Ta reda på vilken referenskategori som används genom att undersöka strukturen hos
ir_cat(i hela datamängdenloan_data). Använd funktionentable()för att göra det.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Build a glm model with variable ir_cat as a predictor
# Print the parameter estimates
# Look at the different categories in ir_cat using table()