Tạo mô hình phân biệt tốt hơn
Trong bài tập trước, khoảng giá trị cho xác suất vỡ nợ dự đoán khá hẹp. Như đã thảo luận, xác suất vỡ nợ dự đoán nhỏ là điều dễ hiểu khi tỷ lệ vỡ nợ thấp, nhưng xây dựng các mô hình lớn hơn (về cơ bản là: đưa thêm nhiều biến dự báo) có thể mở rộng khoảng dự đoán của bạn.
Việc điều này có dẫn đến dự đoán tốt hơn hay không vẫn cần được kiểm chứng và phụ thuộc vào chất lượng của các biến dự báo mới thêm vào. Trước hết, hãy xem các mô hình lớn hơn có thể mở rộng khoảng giá trị như thế nào.
Bài tập này là một phần của khóa học
Mô hình hóa rủi ro tín dụng bằng R
Hướng dẫn bài tập
- Tạo
log_model_fullgiống cách bạn đã tạolog_model_small, nhưng lần này hãy bao gồm tất cả biến dự báo khả dụng trong tập dữ liệu. Nếu bạn không muốn gõ tên từng cột, bạn có thể chọn tất cả biến bằngloan_status ~ . - Tạo vector dự đoán
predictions_all_fullcho tất cả trường hợp trong tập kiểm tra bằngpredict(). Lưu ý rằng các giá trị này biểu diễn xác suất vỡ nợ. - Xem khoảng giá trị của các dự đoán.
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Change the code below to construct a logistic regression model using all available predictors in the data set
log_model_small <- glm(loan_status ~ age + ir_cat, family = "binomial", data = training_set)
# Make PD-predictions for all test set elements using the the full logistic regression model
# Look at the predictions range