将插补与建模封装进函数
每当您在含有插补值的数据上进行分析或建模时,都应考虑插补带来的不确定性。只对数据集进行一次插补后直接跑模型,会忽略一个事实:插补对缺失值只是带不确定性的估计。这类模型得到的标准误往往偏小。解决方案是多重插补,其中一种实现方式是自助法(bootstrapping)。
在接下来的练习中,您将继续使用熟悉的 biopics 数据。我们的目标是通过结合自助法的多重插补与线性回归,评估在现有数据下,以女性为主角的传记电影是否比以男性为主角的电影收入更低。
首先,来编写一个函数,用于创建自助样本,对其进行插补,并拟合线性回归模型。
本练习是课程的一部分
R 中的缺失值填补处理
练习说明
- 将
data按indices指示的行进行重抽样切片,并将结果赋给data_boot。 - 使用 5 个邻居对自助样本
data_boot进行 kNN 插补,并将结果赋给data_imp。 - 在
data_imp上拟合线性回归模型,用sub_sex、sub_type和year解释earnings。
交互式实操练习
通过完成这段示例代码来试试这个练习。
calc_gender_coef <- function(data, indices) {
# Get bootstrap sample
data_boot <- data[___, ]
# Impute with kNN imputation
data_imp <- ___
# Fit linear regression
linear_model <- ___
# Extract and return gender coefficient
gender_coefficient <- coef(linear_model)[2]
return(gender_coefficient)
}