經驗法則(Empirical Rule)
在資料分析中常用的許多統計量(包含樣本平均與樣本比例)都有一些良好的性質,可用來更深入瞭解你關心的母體參數。
其中一個性質是:若已知樣本比例的變異程度(稱為「標準誤」,或記為 $SE\(),那麼約有 95% 來自不同樣本的 \)\hat{p}$ 會落在真實母體比例的 \(2SE\) 範圍內。
為了檢查在目前情境是否成立,我們回到先前從同一個母體重複抽樣所產生的民調結果。
all_polls 資料集包含 1000 個樣本,每個樣本大小為 30,且來自一個支持候選人 X 的機率為 0.6 的母體。
注意,你將使用 R 的 sd() 函式來計算一組數字的變異程度。在統計中,當 sd() 用在一個「變數」(例如房價)時,我們稱為「標準差」。當 sd() 用在一個「統計量」(例如一組樣本比例)時,我們稱為「標準誤」。
本練習屬於課程
R 統計推論基礎
練習說明
- 執行程式碼以產生
props,其為每一份民調中計畫投票「yes」的個體比例。此物件是以先前練習中的ex1_props為基礎。 - 新增一個欄位
is_in_conf_int:當樣本中的 yes 比例與母體真實 yes 比例的距離小於 2 個標準誤時為TRUE。也就是說,prop_yes與true_prop_yes的abs()差值小於prop_yes的sd()的 2 倍。 - 透過對
is_in_conf_int取mean(),計算落在信賴區間內的樣本統計量比例prop_in_conf_int。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Proportion of yes votes by poll
props <- all_polls %>%
group_by(poll) %>%
summarize(prop_yes = mean(vote == "yes"))
# The true population proportion of yes votes
true_prop_yes <- 0.6
# Proportion of polls within 2SE
props %>%
# Add column: is prop_yes in 2SE of 0.6
mutate(is_in_conf_int = ___(___ - ___) < ___ * ___(___)) %>%
# Calculate proportion in conf int
summarize(prop_in_conf_int = ___(___))