始める無料で始める

標本比率の値がブートストラップ信頼区間に与える影響

信頼区間の幅を変えるもう1つの要素は、標本パラメータの値、\(\hat{p}\) です。

一般に、真のパラメータが 0.5 に近いとき、\(\hat{p}\) の標準誤差は、真のパラメータが 0 や 1 に近いときよりも大きくなります。ブートストラップによる t 信頼区間を計算するとき、標準誤差は信頼区間(CI)の幅を左右します。ここでは(真のパラメータが 0.8 であるとき)、標本比率はこれまでの演習よりも高いため、信頼区間の幅はより狭くなります。

この演習はコースの一部です

Rによる推測の基礎

コースを見る

演習の手順

  • 標本比率を計算するための calc_p_hat() がスクリプトに示されています。前の演習の calc_t_conf_int() は、任意の p_hat の値を引数に取れるように更新されています。定義を読んで理解してみましょう。
  • 元の母集団について、ブートストラップによる t 信頼区間を計算するコードを実行します。
  • 真のパラメータが 0.8 の新しい母集団 one_poll_0.8 を考えます。元のデータセットと同じ手順で、この新しい標本の \(\hat{p}\) を計算し、p_hat_0.8 と名付けます。
  • 新しいブートストラップデータ one_poll_boot_0.8 と新しい \(\hat{p}\) を使って、ブートストラップによる t 信頼区間を求めます。先ほどよりも狭くなっている点に注目してください。

実践的なインタラクティブ演習

このサンプルコードを完成させて、この演習に挑戦してみましょう。

calc_p_hat <- function(dataset) {
  dataset %>%
    summarize(stat = mean(vote == "yes")) %>%
    pull()
}
calc_t_conf_int <- function(resampled_dataset, p_hat) {
  resampled_dataset %>%
    summarize(
      lower = p_hat - 2 * sd(stat),
      upper = p_hat + 2 * sd(stat)
    )
}

# Find proportion of yes votes from original population
p_hat <- calc_p_hat(one_poll)

# Review the value
p_hat  

# Calculate bootstrap t-confidence interval (original 0.6 param)
calc_t_conf_int(one_poll_boot, p_hat)

# Find proportion of yes votes from new population
p_hat_0.8 <- ___
  
# Review the value
p_hat_0.8  
  
# Calculate the bootstrap t-confidence interval (new 0.8 param)
___
コードを編集して実行