对 NHANES 数据重新抽样
NHANES 数据是对按计划抽取的个体(人)进行采集,以代表美国总体。不过,我们将以不同方式对 nhanes_final 数据集重新抽样,以便直观比较不同的抽样方法。
我们可以使用 dplyr 中的 slice_sample() 进行简单随机抽样。它的输入是一个数据集,以及表示要抽取行数的整数。
分层抽样可以结合使用 group_by() 和 slice_sample() 来完成。该函数会从 group_by() 指定的每个分组中抽取 n 个样本。
sampling 包中的 cluster() 可用于进行整群抽样。它需要传入数据集名称、用作群集变量的数据集中的变量(以包含该变量名字符串的向量形式传入,例如 c("variable"))、要选择的群集数量,以及抽样方法。
本练习是课程的一部分
R 中的实验设计
练习说明
- 使用
slice_sample()从nhanes_final中选取 2500 条观测,并保存为nhanes_srs。 - 使用
group_by()和slice_sample()创建nhanes_stratified。按riagendr分层,并为每个性别各抽取 2000 个样本。用count()检查nhanes_stratified的性别变量,确认分层是否生效。 - 加载
sampling包。使用cluster()按"indhhin2"将nhanes_final分为 6 个群集,抽样方法使用"srswor"。将结果赋给nhanes_cluster。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Use slice_sample() to create nhanes_srs
nhanes_srs <- ___ %>% ___(n=___)
# Create nhanes_stratified with group_by() and slice_sample()
___ <- ___ %>% group_by(___) %>% ___(n=___)
nhanes_stratified %>% ___
# Load sampling package and create nhanes_cluster with cluster()
___
nhanes_cluster <- cluster(___, "___", 6, method = "srswor")