Вычисление p-значений
В видеоуроке вы узнали, что p-значение измеряет степень расхождения между данными и нулевой гипотезой. Здесь вы вычислите p-значение для исходного набора данных о дискриминации, а также для его уменьшенной и увеличенной версий — disc_small и disc_big.
В вашей рабочей среде доступны исходные разности пропорций: diff_orig, diff_orig_small и diff_orig_big, а также наборы данных с перестановками: disc_perm, disc_perm_small и disc_perm_big.
Напомним, что здесь вас интересует односторонний критерий проверки гипотезы. Иными словами, вы пытаетесь ответить на вопрос: «Вероятность получить повышение у мужчин выше, чем у женщин?»
Это упражнение является частью курса
Основы статистического вывода в R
Инструкции к упражнению
- Примените функции
visualize()иget_p_value()из пакетаinfer. Помните, что значения статистики при нулевой гипотезе меньше исходной разности, поэтому p-значение (то есть доля случаев, когда нулевое значение оказывается более экстремальным) вычисляется как количество нулевых значений, превышающих исходную разность. - Повторите то же самое для уменьшенного набора данных
disc_perm_small, у которого наблюдаемая разность равнаdiff_orig_small. - Повторите для увеличенного набора данных
disc_perm_big, у которого наблюдаемая разность равнаdiff_orig_big. - Перед отправкой ответа попробуйте различные варианты:
direction = "greater",direction = "two_sided"иdirection = "less"— это поможет лучше закрепить материал.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Visualize and calculate the p-value for the original dataset
disc_perm %>%
___(obs_stat = ___, direction = "___")
disc_perm %>%
___(___, ___)
# Visualize and calculate the p-value for the small dataset
___ %>%
___(___, ___)
___ %>%
___(___, ___)
# Visualize and calculate the p-value for the big dataset
___ %>%
___(___, ___)
___ %>%
___(___, ___)