開始使用免費開始

Bootstrap 的 t 信賴區間

前面的練習告訴你兩件事:

  1. 你可以透過從原始樣本重抽樣,來量化與 \(\hat{p}\) 相關的變異性。
  2. 一旦你知道 \(\hat{p}\) 的變異性,就能用它來衡量真實比例與估計值之間的距離。

請注意,接近的「比率」(此處為 95%)指的是:隨機抽出的樣本有多常能夠接近母體母數。你無法知道某一筆特定資料是否接近或遠離母數,但你可以知道,長期下來,你所收集的樣本中有 95% 應會在距離真實母體母數 \(2SE\) 以內給出估計值。

單一次民調的投票資料 one_poll,以及 1000 次 bootstrap 重抽樣得到的資料 one_poll_boot 已經在你的工作空間中。這些資料來自本章前面提到的實驗 2。

和上一題一樣,在討論統計量的變異性時,這個數值稱為「標準誤」(standard error)。

本練習屬於課程

R 統計推論基礎

檢視課程

練習說明

  • 計算 \(\hat{p}\) 並指定給 p_hat。在呼叫 summarize() 時,將 stat 設為 vote 等於 "yes" 的平均值。
  • 透過計算 $\hat{p} \pm 2SE$,找出真實母數的合理區間。
    • 信賴區間的 lower 下界為 p_hat 減去兩倍 stat 的標準誤。使用 sd() 計算標準誤。
    • upper 上界為 p_hat 加上兩倍 stat 的標準誤。

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# From previous exercises
one_poll <- all_polls %>%
  filter(poll == 1) %>%
  select(vote)
one_poll_boot <- one_poll %>%
  specify(response = vote, success = "yes") %>%
  generate(reps = 1000, type = "bootstrap") %>% 
  calculate(stat = "prop")
  
p_hat <- one_poll %>%
  # Calculate proportion of yes votes
  summarize(stat = ___) %>%
  pull()

# Create an interval of plausible values
one_poll_boot %>%
  summarize(
    # Lower bound is p_hat minus 2 std errs
    lower = ___,
    # Upper bound is p_hat plus 2 std errs
    upper = ___
  )
編輯並執行程式碼