Giữ lại dữ liệu thiếu
Trong một số trường hợp, việc một đầu vào bị thiếu tự thân nó đã là thông tin quan trọng. Bạn có thể giữ các giá trị NA trong một hạng mục "missing" riêng bằng cách phân loại thô.
Phân loại thô giúp đơn giản hóa dữ liệu và cải thiện khả năng diễn giải của mô hình. Cách này yêu cầu bạn gom các giá trị phản hồi vào những nhóm theo khoảng giá trị. Bạn có thể dùng kỹ thuật gom nhóm này để đặt toàn bộ NA vào một nhóm riêng.
Trong video, chúng ta minh họa ý tưởng phân loại thô cho số năm làm việc. Mã từ ví dụ đó đã được đưa sẵn trong R script bên phải và có thể điều chỉnh để phân loại thô biến int_rate.
Bài tập này là một phần của khóa học
Mô hình hóa rủi ro tín dụng bằng R
Hướng dẫn bài tập
- Thực hiện các thay đổi cần thiết đối với đoạn mã đã cho để phân loại thô
int_rate, và lưu kết quả vào biến mới tênir_cat.- Đầu tiên, thay
loan_data$emp_catbằngloan_data$ir_catở mọi chỗ trong R script, đồng thời thayloan_data$emp_lengthbằngloan_data$int_rate. - Tiếp theo, các biến cần được gom nhóm vào các hạng mục
"0-8","8-11","11-13.5", và"13.5+"(thay cho"0-15","15-30","30-45"và"45+"). Cách dùng>và<=hoàn toàn giống như trong video. Nhớ đổi cả các con số trong các biểu thức điều kiện nữa (15, 30 và 45 tương ứng đổi thành 8, 11 và 13.5).
- Đầu tiên, thay
- Xem biến mới
ir_catcủa bạn bằngplot(loan_data$ir_cat).
Bài tập tương tác thực hành trực tiếp
Hãy thử làm bài tập này bằng cách hoàn thành đoạn mã mẫu này.
# Make the necessary replacements in the coarse classification example below
loan_data$emp_cat <- rep(NA, length(loan_data$emp_length))
loan_data$emp_cat[which(loan_data$emp_length <= 15)] <- "0-15"
loan_data$emp_cat[which(loan_data$emp_length > 15 & loan_data$emp_length <= 30)] <- "15-30"
loan_data$emp_cat[which(loan_data$emp_length > 30 & loan_data$emp_length <= 45)] <- "30-45"
loan_data$emp_cat[which(loan_data$emp_length > 45)] <- "45+"
loan_data$emp_cat[which(is.na(loan_data$emp_length))] <- "Missing"
loan_data$emp_cat <- as.factor(loan_data$emp_cat)
# Look at your new variable using plot()