尋找可預測的遺漏情形
如果資料是完全隨機遺漏(MCAR),你就不應該能夠根據其餘資料來預測某個變數何時會遺漏。因此,若你能預測遺漏情形,代表資料並非完全隨機遺漏。現在,讓我們使用 glm() 來配適邏輯斯迴歸,根據你先前建立的 mort 變數中的 affordability,檢視遺漏情形。即使你在遺漏值中找不到結構——也就是斜率變數不顯著——這並不代表你已經證明資料是隨機遺漏,但這種情況是有可能的。
本練習屬於課程
R 的可擴展資料處理
練習說明
- 在房貸資料中建立一個變數,標示
"borrower_race"是否遺漏(等於 9)。 - 將
"affordability"欄位轉成 factor 類別變數。 - 對
affordability_factor以borrower_race_ind做迴歸,並對結果呼叫summary()。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Create a variable indicating if borrower_race is missing in the mortgage data
borrower_race_ind <- mort[, ___] == 9
# Create a factor variable indicating the affordability
affordability_factor <- ___(mort[, ___])
# Perform a logistic regression
___(glm(___ ~ affordability_factor, family = binomial))