Густина рандомізації
Використання 100 повторів допомагає зрозуміти механізм перетасовування. Однак 100 — замало, щоб побачити повний діапазон імовірних значень нульових різниць у частках.
Згадайте чотири кроки статистичного висновування. Це ті самі чотири кроки, які ви застосовуватимете в усіх вправах з інференції в цьому курсі та в подальших курсах зі статистичного висновування. Скористайтеся назвами функцій, щоб пригадати послідовність аналізу.
specifyзадає залежну та пояснювальну змінні.hypothesizeформулює нульову гіпотезу.generateстворює повторні вибірки, перестановки або моделювання.calculateобчислює підсумкові статистики.
У цій вправі ви повторите процес 1000 разів, щоб побачити повний розподіл нульових різниць у частках.
Ця вправа є частиною курсу
Основи інференції в R
Інструкції до вправи
Пакети dplyr, ggplot2, NHANES та infer уже завантажено для вас.
- Згенеруйте 1000 різниць у частках, перетасовуючи змінну
HomeOwnза допомогою синтаксисуinfer. Нагадаємо синтаксисinfer:specify— вкажіть, що нас цікавить зв'язок міжHomeOwnіGender, а успіхом у цьому контексті є володіння житлом,success = "Own".hypothesize— припустіть, що нульова гіпотеза істинна, деnull = "independence"(тобто стать і володіння житлом не пов'язані).generate— виконайте 1000 перестановок; встановітьrepsу 1000.calculate— обчисліть статистикуstat = "diff in props"з порядкомc("male", "female").
- Запустіть код для графіка густини, щоб отримати згладжене візуальне подання розподілу різниць. Яку форму має крива?
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Perform 1000 permutations
homeown_perm <- homes %>%
# Specify HomeOwn vs. Gender, with `"Own" as success
___(___ ~ ___, success = "___") %>%
# Use a null hypothesis of independence
___(___) %>%
# Generate 1000 repetitions (by permutation)
___(reps = ___, type = "permute") %>%
# Calculate the difference in proportions (male then female)
___(___, order = ___))
# Density plot of 1000 permuted differences in proportions
ggplot(homeown_perm, aes(x = stat)) +
geom_density()