构造置信区间(CI)
您已经看到一次重抽样时 p-hat 如何变化,但为了较好地估计其变异性,我们需要进行非常多次重抽样。这里,您将计算完整的自助法(bootstrap)分布,以估计将用于构建置信区间的标准误(SE)。您将使用 infer 包中的另一个动词 calculate(),以便高效地从多个数据集计算许多统计量。
先花点时间查看 calculate 的输出。这个函数会将数据框缩减为两列:一列为对应的统计量 "stat",另一列为它所属的 "replicate"。
当您绘制自助法分布时,会发现它呈钟形。正是这种形状使您可以加减两个 SE 来得到 95% 区间。
本练习是课程的一部分
R 中的分类数据推断
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Create bootstrap distribution for proportion with High conf
boot_dist <- gss2016 %>%
# Specify the response and success
specify(response = ___, ___ = "___") %>%
# Generate 500 bootstrap reps
generate(___ = ___, type = "bootstrap") %>%
# Calculate proportions
calculate(stat = "___")
# See the result
boot_dist