开始使用免费开始使用

对 NHANES 数据重新抽样

NHANES 数据是对按计划抽取的个体(人)进行采集,以代表美国总体。不过,我们将以不同方式对 nhanes_final 数据集重新抽样,以便直观比较不同的抽样方法。

我们可以使用 dplyr 中的 slice_sample() 进行简单随机抽样。它的输入是一个数据集,以及表示要抽取行数的整数。

分层抽样可以结合使用 group_by()slice_sample() 来完成。该函数会从 group_by() 指定的每个分组中抽取 n 个样本。

sampling 包中的 cluster() 可用于进行整群抽样。它需要传入数据集名称、用作群集变量的数据集中的变量(以包含该变量名字符串的向量形式传入,例如 c("variable"))、要选择的群集数量,以及抽样方法。

本练习是课程的一部分

R 中的实验设计

查看课程

练习说明

  • 使用 slice_sample()nhanes_final 中选取 2500 条观测,并保存为 nhanes_srs
  • 使用 group_by()slice_sample() 创建 nhanes_stratified。按 riagendr 分层,并为每个性别各抽取 2000 个样本。用 count() 检查 nhanes_stratified 的性别变量,确认分层是否生效。
  • 加载 sampling 包。使用 cluster()"indhhin2"nhanes_final 分为 6 个群集,抽样方法使用 "srswor"。将结果赋给 nhanes_cluster

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Use slice_sample() to create nhanes_srs
nhanes_srs <- ___ %>% ___(n=___)

# Create nhanes_stratified with group_by() and slice_sample()
___ <- ___ %>% group_by(___) %>% ___(n=___)
nhanes_stratified %>% ___

# Load sampling package and create nhanes_cluster with cluster()
___
nhanes_cluster <- cluster(___, "___", 6, method = "srswor")
编辑并运行代码