Плотность распределения при рандомизации
Использование 100 повторений помогает понять механизм перестановок. Однако 100 итераций недостаточно, чтобы охватить полный диапазон вероятных значений нулевых различий в долях.
Вспомните четыре шага статистического вывода. Именно эти шаги будут использоваться во всех упражнениях по выводу в данном курсе и в последующих курсах по статистическому выводу. Названия функций помогут вам воспроизвести процесс анализа.
specify— задаёт переменные отклика и объяснения.hypothesize— формулирует нулевую гипотезу.generate— генерирует повторные выборки, перестановки или симуляции.calculate— вычисляет сводные статистики.
В этом упражнении вы повторите процесс 1000 раз, чтобы получить представление о полном распределении нулевых различий в долях.
Это упражнение является частью курса
Основы статистического вывода в R
Инструкции к упражнению
Пакеты dplyr, ggplot2, NHANES и infer уже загружены для вас.
- Получите 1000 различий в долях, перемешав переменную
HomeOwnс помощью синтаксисаinfer. Напомним синтаксисinfer:specify— укажите, что анализируется зависимостьHomeOwnотGender, а успехом в данном контексте является владение жильём:success = "Own".hypothesize— задайте нулевую гипотезу:null = "independence"(то есть пол и факт владения жильём не связаны).generate— создайте 1000 перестановок; задайтеrepsравным 1000.calculate— вычислите статистикуstat = "diff in props"с порядкомc("male", "female").
- Запустите код построения графика плотности, чтобы получить сглаженное визуальное представление распределения различий. Какую форму имеет кривая?
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Perform 1000 permutations
homeown_perm <- homes %>%
# Specify HomeOwn vs. Gender, with `"Own" as success
___(___ ~ ___, success = "___") %>%
# Use a null hypothesis of independence
___(___) %>%
# Generate 1000 repetitions (by permutation)
___(reps = ___, type = "permute") %>%
# Calculate the difference in proportions (male then female)
___(___, order = ___))
# Density plot of 1000 permuted differences in proportions
ggplot(homeown_perm, aes(x = stat)) +
geom_density()