随机化密度
进行 100 次重复可以帮助您理解置换的机制。然而,100 次不足以观察到原假设下比例差异的所有可能取值范围。
回顾推断的四个步骤。这四步将在本课程及后续统计推断课程的所有推断练习中使用。使用函数名来帮助您回忆分析流程。
specify用于指定响应变量和解释变量。hypothesize用于陈述原假设。generate用于生成重抽样、置换或模拟。calculate用于计算汇总统计量。
在本练习中,您将把该过程重复 1000 次,以便了解原假设下比例差异的完整分布。
本练习是课程的一部分
R 推断基础
练习说明
已为您加载 dplyr、ggplot2、NHANES 和 infer 包。
- 使用
infer语法,通过对HomeOwn变量洗牌生成 1000 个比例差异。回顾infer语法:specify指定关注的关系为HomeOwn与Gender,且在此情境下的成功为拥有住房,success = "Own"。hypothesize指定原假设成立,即null = "independence"(表示性别与是否拥有住房不相关)。generate进行 1000 次置换;将reps设为 1000。calculate统计量stat = "diff in props",并设定顺序为c("male", "female")。
- 运行密度图代码,创建平滑的差异分布可视化。这条曲线是什么形状?
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Perform 1000 permutations
homeown_perm <- homes %>%
# Specify HomeOwn vs. Gender, with `"Own" as success
___(___ ~ ___, success = "___") %>%
# Use a null hypothesis of independence
___(___) %>%
# Generate 1000 repetitions (by permutation)
___(reps = ___, type = "permute") %>%
# Calculate the difference in proportions (male then female)
___(___, order = ___))
# Density plot of 1000 permuted differences in proportions
ggplot(homeown_perm, aes(x = stat)) +
geom_density()