開始使用免費開始

尋找可預測的遺漏情形

如果資料是完全隨機遺漏(MCAR),你就不應該能夠根據其餘資料來預測某個變數何時會遺漏。因此,若你能預測遺漏情形,代表資料並非完全隨機遺漏。現在,讓我們使用 glm() 來配適邏輯斯迴歸,根據你先前建立的 mort 變數中的 affordability,檢視遺漏情形。即使你在遺漏值中找不到結構——也就是斜率變數不顯著——這並不代表你已經證明資料是隨機遺漏,但這種情況是有可能的。

本練習屬於課程

R 的可擴展資料處理

檢視課程

練習說明

  • 在房貸資料中建立一個變數,標示 "borrower_race" 是否遺漏(等於 9)。
  • "affordability" 欄位轉成 factor 類別變數。
  • affordability_factorborrower_race_ind 做迴歸,並對結果呼叫 summary()

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Create a variable indicating if borrower_race is missing in the mortgage data
borrower_race_ind <- mort[, ___] == 9

# Create a factor variable indicating the affordability
affordability_factor <- ___(mort[, ___])

# Perform a logistic regression
___(glm(___ ~ affordability_factor, family = binomial))
編輯並執行程式碼