计算 p 值
在视频中,您学到 p 值衡量的是数据与原假设之间的不一致程度。这里,您将为原始的歧视数据集以及其小型和大型版本(disc_small 和 disc_big)计算 p 值。
您在工作空间中已拥有原始的比例差异 diff_orig、diff_orig_small 和 diff_orig_big,以及相应的置换数据集 disc_perm、disc_perm_small 和 disc_perm_big。
回顾一下,这里我们只关心单侧检验。也就是说,您在回答这样一个问题:"男性被晋升的可能性是否高于女性?"
本练习是课程的一部分
R 推断基础
练习说明
- 使用内置的
infer函数visualize()和get_p_value()。请记住,原假设下的统计量都低于原始差值,因此 p 值(表示原假设值有多频繁更"极端")是通过统计那些比原始差值更greater的原假设值来计算的。 - 对小型数据集
disc_perm_small重复上述步骤,其观测差值为diff_orig_small。 - 对大型数据集
disc_perm_big重复上述步骤,其观测差值为diff_orig_big。 - 在提交答案前,您可以尝试不同方向以检验理解:
direction = "greater"、direction = "two_sided"和direction = "less"。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Visualize and calculate the p-value for the original dataset
disc_perm %>%
___(obs_stat = ___, direction = "___")
disc_perm %>%
___(___, ___)
# Visualize and calculate the p-value for the small dataset
___ %>%
___(___, ___)
___ %>%
___(___, ___)
# Visualize and calculate the p-value for the big dataset
___ %>%
___(___, ___)
___ %>%
___(___, ___)