开始使用免费开始使用

将插补与建模封装进函数

每当您在含有插补值的数据上进行分析或建模时,都应考虑插补带来的不确定性。只对数据集进行一次插补后直接跑模型,会忽略一个事实:插补对缺失值只是带不确定性的估计。这类模型得到的标准误往往偏小。解决方案是多重插补,其中一种实现方式是自助法(bootstrapping)。

在接下来的练习中,您将继续使用熟悉的 biopics 数据。我们的目标是通过结合自助法的多重插补与线性回归,评估在现有数据下,以女性为主角的传记电影是否比以男性为主角的电影收入更低。

首先,来编写一个函数,用于创建自助样本,对其进行插补,并拟合线性回归模型。

本练习是课程的一部分

R 中的缺失值填补处理

查看课程

练习说明

  • dataindices 指示的行进行重抽样切片,并将结果赋给 data_boot
  • 使用 5 个邻居对自助样本 data_boot 进行 kNN 插补,并将结果赋给 data_imp
  • data_imp 上拟合线性回归模型,用 sub_sexsub_typeyear 解释 earnings

交互式实操练习

通过完成这段示例代码来试试这个练习。

calc_gender_coef <- function(data, indices) {
  # Get bootstrap sample
  data_boot <- data[___, ]
  # Impute with kNN imputation
  data_imp <- ___
  # Fit linear regression
  linear_model <- ___
  # Extract and return gender coefficient
  gender_coefficient <- coef(linear_model)[2]
  return(gender_coefficient)
}
编辑并运行代码