mice 工作流:mice - with - pool
基于链式方程的多重插补(MICE)通过在条件分布中抽样、使用基于模型的方法对同一数据集进行多次插补,从而估计由插补带来的不确定性。这样,每个插补后的数据集都会略有不同。随后,对每个数据集分别进行分析,并将结果合并(pool),得到关注的统计量及其置信区间,从而反映插补不确定性。
在本练习中,您将练习典型的 MICE 工作流:mice() - with() - pool()。您将对 biopics 数据进行回归分析,以查看哪种人物职业 sub_type 与最高的电影票房 earnings 相关。让我们来玩转 mice 吧!
本练习是课程的一部分
R 中的缺失值填补处理
练习说明
- 加载
mice包,并使用mice()对biopics进行 5 次插补,将结果保存为biopics_multiimp。 - 在每个插补数据集上拟合线性回归模型,用
year和sub_type解释earnings,将结果保存为lm_multiimp。 - 将保存在
lm_multiimp中的回归模型进行合并(pool),将结果保存为lm_pooled。 - 汇总
lm_pooled,并生成置信水平为 95% 的置信区间。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Load mice package
___
# Impute biopics with mice using 5 imputations
biopics_multiimp <- ___(___, m = ___, seed = 3108)
# Fit linear regression to each imputed data set
lm_multiimp <- ___(___, ___)
# Pool and summarize regression results
lm_pooled <- ___(___)
___(___, conf.int = ___, conf.level = ___)