Tvorba diskriminativnějších modelů
V předchozím cvičení byl rozsah predikovaných pravděpodobností defaultu poměrně malý. Jak jsme si řekli, nízké predikované pravděpodobnosti defaultu jsou při nízkých mírách defaultu očekávatelné – ale větší modely (tedy modely s více prediktory) dokážou tento rozsah rozšířit.
Zda to nakonec povede k lepším predikcím, je třeba ověřit a záleží na kvalitě nově přidaných prediktorů. Nejdřív se ale podívejme, jak větší modely dokážou rozsah predikcí rozšířit.
Toto cvičení je součástí kurzu
Modelování kreditního rizika v R
Pokyny k cvičení
- Vytvoř
log_model_fullstejným způsobem jakolog_model_small, tentokrát ale zahrň všechny dostupné prediktory v datové sadě. Pokud nechceš vypisovat názvy všech sloupců zvlášť, můžeš jednoduše vybrat všechny proměnné pomocíloan_status ~ . - Vytvoř vektor predikcí
predictions_all_fullpro všechny záznamy v testovací sadě pomocí funkcepredict(). Všimni si, že tyto hodnoty představují pravděpodobnost defaultu. - Podívej se na rozsah predikcí.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Change the code below to construct a logistic regression model using all available predictors in the data set
log_model_small <- glm(loan_status ~ age + ir_cat, family = "binomial", data = training_set)
# Make PD-predictions for all test set elements using the the full logistic regression model
# Look at the predictions range