Влияние объёма выборки на доверительные интервалы бутстрэпа
В одном из предыдущих заданий с множественным выбором вы заметили: если повторно брать выборку неправильного размера (например, 300 или 3 вместо 30), стандартная ошибка (SE) выборочных долей оказывается некорректной. При 300 наблюдениях в повторной выборке SE получается слишком маленькой, а при 3 наблюдениях — слишком большой.
В этом упражнении вы воспользуетесь некорректной стандартной ошибкой (рассчитанной на основе неправильного размера выборки), чтобы построить доверительный интервал. Идея состоит в том, что при неверной стандартной ошибке полученный интервал не только теряет практическую ценность, но и оказывается статистически некорректным.
Это упражнение является частью курса
Основы статистического вывода в R
Инструкции к упражнению
- В скрипте представлена функция для вычисления t-доверительного интервала методом бутстрэпа —
calc_t_conf_int(). Изучите код и разберитесь, как она работает. - Вызовите
calc_t_conf_int()дляone_poll_boot, чтобы вычислить корректный t-доверительный интервал. - Сделайте то же самое для
one_poll_boot_300, чтобы получить некорректный интервал для повторных выборок размером 300. - Сделайте то же самое для
one_poll_boot_3, чтобы получить некорректный интервал для повторных выборок размером 3.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
calc_t_conf_int <- function(resampled_dataset) {
resampled_dataset %>%
summarize(
lower = p_hat - 2 * sd(stat),
upper = p_hat + 2 * sd(stat)
)
}
# Find the bootstrap t-confidence interval for 30 resamples
calc_t_conf_int(___)
# ... and for 300 resamples
___
# ... and for 3 resamples
___