НачатьНачать бесплатно

Рандомизация в задаче о гендерной дискриминации

Напомним, что мы рассматриваем ситуацию, в которой количество мужчин и женщин фиксировано (они представляют резюме), а число повышений также фиксировано (менеджеры могли повысить не более 35 человек).

В этом упражнении вы построите распределение нулевой статистики на основе рандомизации с 1000 повторений — в отличие от всего 5 повторений в предыдущем упражнении. Напомним, что интересующая нас статистика — это разница в долях повышений между мужчинами и женщинами (то есть доля мужчин минус доля женщин). По исходному набору данных можно вычислить, насколько отличаются показатели повышений для разных полов. С помощью рабочего процесса specify–hypothesize–generate–calculate в пакете infer можно вычислить ту же статистику, но вместо одного числа получить целое распределение. В этом упражнении вы сравните одно число из исходного набора данных с распределением, полученным в результате симуляции.

Это упражнение является частью курса

Основы статистического вывода в R

Посмотреть курс

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Calculate the observed difference in promotion rate
diff_orig <- disc %>%
  # Group by sex
  group_by(___) %>%
  # Summarize to calculate fraction promoted
  ___(prop_prom = ___(___)) %>%
  # Summarize to calculate difference
  ___(stat = ___(___)) %>% 
  pull()
    
# See the result
diff_orig
Редактировать и запускать код