標本比率の値がブートストラップ信頼区間に与える影響
信頼区間の幅を変えるもう1つの要素は、標本パラメータの値、\(\hat{p}\) です。
一般に、真のパラメータが 0.5 に近いとき、\(\hat{p}\) の標準誤差は、真のパラメータが 0 や 1 に近いときよりも大きくなります。ブートストラップによる t 信頼区間を計算するとき、標準誤差は信頼区間(CI)の幅を左右します。ここでは(真のパラメータが 0.8 であるとき)、標本比率はこれまでの演習よりも高いため、信頼区間の幅はより狭くなります。
この演習はコースの一部です
Rによる推測の基礎
演習の手順
- 標本比率を計算するための
calc_p_hat()がスクリプトに示されています。前の演習のcalc_t_conf_int()は、任意のp_hatの値を引数に取れるように更新されています。定義を読んで理解してみましょう。 - 元の母集団について、ブートストラップによる t 信頼区間を計算するコードを実行します。
- 真のパラメータが 0.8 の新しい母集団
one_poll_0.8を考えます。元のデータセットと同じ手順で、この新しい標本の \(\hat{p}\) を計算し、p_hat_0.8と名付けます。 - 新しいブートストラップデータ
one_poll_boot_0.8と新しい \(\hat{p}\) を使って、ブートストラップによる t 信頼区間を求めます。先ほどよりも狭くなっている点に注目してください。
実践的なインタラクティブ演習
このサンプルコードを完成させて、この演習に挑戦してみましょう。
calc_p_hat <- function(dataset) {
dataset %>%
summarize(stat = mean(vote == "yes")) %>%
pull()
}
calc_t_conf_int <- function(resampled_dataset, p_hat) {
resampled_dataset %>%
summarize(
lower = p_hat - 2 * sd(stat),
upper = p_hat + 2 * sd(stat)
)
}
# Find proportion of yes votes from original population
p_hat <- calc_p_hat(one_poll)
# Review the value
p_hat
# Calculate bootstrap t-confidence interval (original 0.6 param)
calc_t_conf_int(one_poll_boot, p_hat)
# Find proportion of yes votes from new population
p_hat_0.8 <- ___
# Review the value
p_hat_0.8
# Calculate the bootstrap t-confidence interval (new 0.8 param)
___