開始使用免費開始

經驗法則(Empirical Rule)

在資料分析中常用的許多統計量(包含樣本平均與樣本比例)都有一些良好的性質,可用來更深入瞭解你關心的母體參數。

其中一個性質是:若已知樣本比例的變異程度(稱為「標準誤」,或記為 $SE\(),那麼約有 95% 來自不同樣本的 \)\hat{p}$ 會落在真實母體比例的 \(2SE\) 範圍內。

為了檢查在目前情境是否成立,我們回到先前從同一個母體重複抽樣所產生的民調結果。

all_polls 資料集包含 1000 個樣本,每個樣本大小為 30,且來自一個支持候選人 X 的機率為 0.6 的母體。

注意,你將使用 R 的 sd() 函式來計算一組數字的變異程度。在統計中,當 sd() 用在一個「變數」(例如房價)時,我們稱為「標準差」。當 sd() 用在一個「統計量」(例如一組樣本比例)時,我們稱為「標準誤」。

本練習屬於課程

R 統計推論基礎

檢視課程

練習說明

  • 執行程式碼以產生 props,其為每一份民調中計畫投票「yes」的個體比例。此物件是以先前練習中的 ex1_props 為基礎。
  • 新增一個欄位 is_in_conf_int:當樣本中的 yes 比例與母體真實 yes 比例的距離小於 2 個標準誤時為 TRUE。也就是說,prop_yestrue_prop_yesabs() 差值小於 prop_yessd() 的 2 倍。
  • 透過對 is_in_conf_intmean(),計算落在信賴區間內的樣本統計量比例 prop_in_conf_int

動手互動練習

試著完成這個範例程式碼,體驗一下這個練習。

# Proportion of yes votes by poll
props <- all_polls %>% 
  group_by(poll) %>% 
  summarize(prop_yes = mean(vote == "yes"))

# The true population proportion of yes votes
true_prop_yes <- 0.6

# Proportion of polls within 2SE
props %>%
  # Add column: is prop_yes in 2SE of 0.6
  mutate(is_in_conf_int = ___(___ - ___) < ___ * ___(___)) %>%
  # Calculate  proportion in conf int
  summarize(prop_in_conf_int = ___(___))
編輯並執行程式碼