Bootstrap 的 t 信賴區間
前面的練習告訴你兩件事:
- 你可以透過從原始樣本重抽樣,來量化與 \(\hat{p}\) 相關的變異性。
- 一旦你知道 \(\hat{p}\) 的變異性,就能用它來衡量真實比例與估計值之間的距離。
請注意,接近的「比率」(此處為 95%)指的是:隨機抽出的樣本有多常能夠接近母體母數。你無法知道某一筆特定資料是否接近或遠離母數,但你可以知道,長期下來,你所收集的樣本中有 95% 應會在距離真實母體母數 \(2SE\) 以內給出估計值。
單一次民調的投票資料 one_poll,以及 1000 次 bootstrap 重抽樣得到的資料 one_poll_boot 已經在你的工作空間中。這些資料來自本章前面提到的實驗 2。
和上一題一樣,在討論統計量的變異性時,這個數值稱為「標準誤」(standard error)。
本練習屬於課程
R 統計推論基礎
練習說明
- 計算 \(\hat{p}\) 並指定給
p_hat。在呼叫summarize()時,將stat設為vote等於"yes"的平均值。 - 透過計算 $\hat{p} \pm 2SE$,找出真實母數的合理區間。
- 信賴區間的
lower下界為p_hat減去兩倍stat的標準誤。使用sd()計算標準誤。 upper上界為p_hat加上兩倍stat的標準誤。
- 信賴區間的
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# From previous exercises
one_poll <- all_polls %>%
filter(poll == 1) %>%
select(vote)
one_poll_boot <- one_poll %>%
specify(response = vote, success = "yes") %>%
generate(reps = 1000, type = "bootstrap") %>%
calculate(stat = "prop")
p_hat <- one_poll %>%
# Calculate proportion of yes votes
summarize(stat = ___) %>%
pull()
# Create an interval of plausible values
one_poll_boot %>%
summarize(
# Lower bound is p_hat minus 2 std errs
lower = ___,
# Upper bound is p_hat plus 2 std errs
upper = ___
)