НачатьНачать бесплатно

Плотность распределения при рандомизации

Использование 100 повторений помогает понять механизм перестановок. Однако 100 итераций недостаточно, чтобы охватить полный диапазон вероятных значений нулевых различий в долях.

Вспомните четыре шага статистического вывода. Именно эти шаги будут использоваться во всех упражнениях по выводу в данном курсе и в последующих курсах по статистическому выводу. Названия функций помогут вам воспроизвести процесс анализа.

  • specify — задаёт переменные отклика и объяснения.
  • hypothesize — формулирует нулевую гипотезу.
  • generate — генерирует повторные выборки, перестановки или симуляции.
  • calculate — вычисляет сводные статистики.

В этом упражнении вы повторите процесс 1000 раз, чтобы получить представление о полном распределении нулевых различий в долях.

Это упражнение является частью курса

Основы статистического вывода в R

Посмотреть курс

Инструкции к упражнению

Пакеты dplyr, ggplot2, NHANES и infer уже загружены для вас.

  • Получите 1000 различий в долях, перемешав переменную HomeOwn с помощью синтаксиса infer. Напомним синтаксис infer:
    • specify — укажите, что анализируется зависимость HomeOwn от Gender, а успехом в данном контексте является владение жильём: success = "Own".
    • hypothesize — задайте нулевую гипотезу: null = "independence" (то есть пол и факт владения жильём не связаны).
    • generate — создайте 1000 перестановок; задайте reps равным 1000.
    • calculate — вычислите статистику stat = "diff in props" с порядком c("male", "female").
  • Запустите код построения графика плотности, чтобы получить сглаженное визуальное представление распределения различий. Какую форму имеет кривая?

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Perform 1000 permutations
homeown_perm <- homes %>%
  # Specify HomeOwn vs. Gender, with `"Own" as success
  ___(___ ~ ___, success = "___") %>%
  # Use a null hypothesis of independence
  ___(___) %>% 
  # Generate 1000 repetitions (by permutation)
  ___(reps = ___, type = "permute") %>% 
  # Calculate the difference in proportions (male then female)
  ___(___, order = ___))

# Density plot of 1000 permuted differences in proportions
ggplot(homeown_perm, aes(x = stat)) + 
  geom_density()
Редактировать и запускать код