mice 流程:mice - with - pool
以連鎖方程進行多重插補(Multiple Imputation by Chained Equations,MICE)能夠透過以模型為基礎、從條件分配抽樣,對同一資料集進行多次插補,來估計插補所帶來的不確定性。如此一來,每個插補後的資料集會略有不同。接著對每個資料集分別進行分析,最後再把結果彙整(pool)在一起,得到你關注的量,同時也會有能反映插補不確定性的信賴區間。
在這個練習中,你將實作典型的 MICE 流程:mice() - with() - pool()。你會在 biopics 資料上進行迴歸分析,找出哪一種主角職業 sub_type 與最高的電影票房(earnings)關聯最大。一起來玩玩 mice 吧!
本練習屬於課程
在 R 中以插補處理遺漏值
練習說明
- 載入
mice套件,並用mice()對biopics進行 5 次插補,將結果指定給biopics_multiimp。 - 對每個插補後的資料集,配適以
year和sub_type解釋earnings的線性迴歸模型,將結果指定給lm_multiimp。 - 將
lm_multiimp中的迴歸模型彙整(pool)在一起,將結果指定給lm_pooled。 - 摘要
lm_pooled,並產生信賴水準為 95% 的信賴區間。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Load mice package
___
# Impute biopics with mice using 5 imputations
biopics_multiimp <- ___(___, m = ___, seed = 3108)
# Fit linear regression to each imputed data set
lm_multiimp <- ___(___, ___)
# Pool and summarize regression results
lm_pooled <- ___(___)
___(___, conf.int = ___, conf.level = ___)