自助法 t 置信区间
前面的练习向您说明了两点:
- 您可以通过从原始样本中重采样来衡量与 \(\hat{p}\) 相关的变异性。
- 一旦知道了 \(\hat{p}\) 的变异性,您就可以用它来衡量真实比例与其相差多远。
请注意,接近程度的「比例」(这里是 95%)指的是抽取的样本有多大概率与总体参数足够接近。对于某个特定数据集究竟接近还是偏离参数,您永远无法确定,但您知道,在您一生所收集的样本中,95% 应该会给出距离真实总体参数在 \(2SE\) 以内的估计。
一个投票的结果 one_poll,以及基于该样本进行 1000 次自助重采样得到的数据 one_poll_boot 已在您的工作区中可用。它们基于本章前面提到的实验 2。
与上一个练习一样,当讨论统计量的变异性时,这个数值称为「标准误」。
本练习是课程的一部分
R 推断基础
练习说明
- 计算 \(\hat{p}\) 并将结果赋给
p_hat。在调用summarize()时,将stat计算为vote等于"yes"的均值。 - 通过计算 $\hat{p} \pm 2SE$,找到对真实参数而言合理的取值区间。
- 置信区间的
lower下界等于p_hat减去stat的 2 倍标准误。使用sd()计算标准误。 upper上界等于p_hat加上stat的 2 倍标准误。
- 置信区间的
交互式实操练习
通过完成这段示例代码来试试这个练习。
# From previous exercises
one_poll <- all_polls %>%
filter(poll == 1) %>%
select(vote)
one_poll_boot <- one_poll %>%
specify(response = vote, success = "yes") %>%
generate(reps = 1000, type = "bootstrap") %>%
calculate(stat = "prop")
p_hat <- one_poll %>%
# Calculate proportion of yes votes
summarize(stat = ___) %>%
pull()
# Create an interval of plausible values
one_poll_boot %>%
summarize(
# Lower bound is p_hat minus 2 std errs
lower = ___,
# Upper bound is p_hat plus 2 std errs
upper = ___
)