开始使用免费开始使用

自助法 t 置信区间

前面的练习向您说明了两点:

  1. 您可以通过从原始样本中重采样来衡量与 \(\hat{p}\) 相关的变异性。
  2. 一旦知道了 \(\hat{p}\) 的变异性,您就可以用它来衡量真实比例与其相差多远。

请注意,接近程度的「比例」(这里是 95%)指的是抽取的样本有多大概率与总体参数足够接近。对于某个特定数据集究竟接近还是偏离参数,您永远无法确定,但您知道,在您一生所收集的样本中,95% 应该会给出距离真实总体参数在 \(2SE\) 以内的估计。

一个投票的结果 one_poll,以及基于该样本进行 1000 次自助重采样得到的数据 one_poll_boot 已在您的工作区中可用。它们基于本章前面提到的实验 2。

与上一个练习一样,当讨论统计量的变异性时,这个数值称为「标准误」。

本练习是课程的一部分

R 推断基础

查看课程

练习说明

  • 计算 \(\hat{p}\) 并将结果赋给 p_hat。在调用 summarize() 时,将 stat 计算为 vote 等于 "yes" 的均值。
  • 通过计算 $\hat{p} \pm 2SE$,找到对真实参数而言合理的取值区间。
    • 置信区间的 lower 下界等于 p_hat 减去 stat 的 2 倍标准误。使用 sd() 计算标准误。
    • upper 上界等于 p_hat 加上 stat 的 2 倍标准误。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# From previous exercises
one_poll <- all_polls %>%
  filter(poll == 1) %>%
  select(vote)
one_poll_boot <- one_poll %>%
  specify(response = vote, success = "yes") %>%
  generate(reps = 1000, type = "bootstrap") %>% 
  calculate(stat = "prop")
  
p_hat <- one_poll %>%
  # Calculate proportion of yes votes
  summarize(stat = ___) %>%
  pull()

# Create an interval of plausible values
one_poll_boot %>%
  summarize(
    # Lower bound is p_hat minus 2 std errs
    lower = ___,
    # Upper bound is p_hat plus 2 std errs
    upper = ___
  )
编辑并运行代码