Построение доверительного интервала
Вы уже видели один пример того, как p-hat может меняться при повторной выборке, но чтобы получить надёжную оценку его изменчивости, этот процесс нужно повторить многократно. В этом упражнении вы построите полное бутстрап-распределение для оценки стандартной ошибки (SE), которая используется при построении доверительного интервала. Чтобы упростить вычисление множества статистик по множеству наборов данных, воспользуйтесь дополнительной функцией из пакета infer — calculate().
Обратите внимание на результат работы calculate(). Эта функция сокращает датафрейм до двух столбцов: один содержит значения статистик (stat), другой — номера соответствующих реплик (replicate).
Когда вы построите бутстрап-распределение, вы увидите, что оно имеет колоколообразную форму. Именно эта форма позволяет прибавить и вычесть два стандартных отклонения, чтобы получить 95%-й интервал.
Это упражнение является частью курса
Статистические выводы для категориальных данных в R
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Create bootstrap distribution for proportion with High conf
boot_dist <- gss2016 %>%
# Specify the response and success
specify(response = ___, ___ = "___") %>%
# Generate 500 bootstrap reps
generate(___ = ___, type = "bootstrap") %>%
# Calculate proportions
calculate(stat = "___")
# See the result
boot_dist