Рандомизация в задаче о гендерной дискриминации
Напомним, что мы рассматриваем ситуацию, в которой количество мужчин и женщин фиксировано (они представляют резюме), а число повышений также фиксировано (менеджеры могли повысить не более 35 человек).
В этом упражнении вы построите распределение нулевой статистики на основе рандомизации с 1000 повторений — в отличие от всего 5 повторений в предыдущем упражнении. Напомним, что интересующая нас статистика — это разница в долях повышений между мужчинами и женщинами (то есть доля мужчин минус доля женщин). По исходному набору данных можно вычислить, насколько отличаются показатели повышений для разных полов. С помощью рабочего процесса specify–hypothesize–generate–calculate в пакете infer можно вычислить ту же статистику, но вместо одного числа получить целое распределение. В этом упражнении вы сравните одно число из исходного набора данных с распределением, полученным в результате симуляции.
Это упражнение является частью курса
Основы статистического вывода в R
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Calculate the observed difference in promotion rate
diff_orig <- disc %>%
# Group by sex
group_by(___) %>%
# Summarize to calculate fraction promoted
___(prop_prom = ___(___)) %>%
# Summarize to calculate difference
___(stat = ___(___)) %>%
pull()
# See the result
diff_orig