開始使用免費開始

mice 流程:mice - with - pool

以連鎖方程進行多重插補(Multiple Imputation by Chained Equations,MICE)能夠透過以模型為基礎、從條件分配抽樣,對同一資料集進行多次插補,來估計插補所帶來的不確定性。如此一來,每個插補後的資料集會略有不同。接著對每個資料集分別進行分析,最後再把結果彙整(pool)在一起,得到你關注的量,同時也會有能反映插補不確定性的信賴區間。

在這個練習中,你將實作典型的 MICE 流程:mice() - with() - pool()。你會在 biopics 資料上進行迴歸分析,找出哪一種主角職業 sub_type 與最高的電影票房(earnings)關聯最大。一起來玩玩 mice 吧!

本練習屬於課程

在 R 中以插補處理遺漏值

檢視課程

練習說明

  • 載入 mice 套件,並用 mice()biopics 進行 5 次插補,將結果指定給 biopics_multiimp
  • 對每個插補後的資料集,配適以 yearsub_type 解釋 earnings 的線性迴歸模型,將結果指定給 lm_multiimp
  • lm_multiimp 中的迴歸模型彙整(pool)在一起,將結果指定給 lm_pooled
  • 摘要 lm_pooled,並產生信賴水準為 95% 的信賴區間。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Load mice package
___

# Impute biopics with mice using 5 imputations
biopics_multiimp <- ___(___, m = ___, seed = 3108)

# Fit linear regression to each imputed data set 
lm_multiimp <- ___(___, ___)

# Pool and summarize regression results
lm_pooled <- ___(___)
___(___, conf.int = ___, conf.level = ___)
編輯並執行程式碼