开始使用免费开始使用

NHANES 数据清洗

在数据清洗过程中,我们发现 16 岁及以下的人没有接受该治疗。回想一下,我们将"医生是否曾建议他们减少饮食中的脂肪或热量"这个变量视为有目的的营养咨询,即我们的处理。请只在数据集中保留年龄大于 16 岁的受试者。

您可能还注意到,ggplot2 的默认设置会删除任何因变量缺失的观测,在这里指体重。处理缺失体重的一种方法是插补,可以使用 simputation 包实现。插补是一种处理缺失值的技术,您可以用汇总统计量(如均值或中位数)替换缺失值,或者使用模型预测一个用于替换的值。

我们将使用 impute_median(),它以数据集和要插补的变量或用于分组插补的公式作为参数。例如,impute_median(ToothGrowth, len ~ dose) 会用按 dose 分组后 len 的中位数填充变量 len 中的任何缺失值。也就是说,如果一只剂量为 2.0 的豚鼠在 len 变量上有缺失值,它将被该剂量组(dose 为 2.0)的 len 中位数所替代。

本练习是课程的一部分

R 中的实验设计

查看课程

练习说明

  • 使用 filter() 创建 nhanes_filter,只保留数据集中年龄大于 16 岁的人群,不包括恰好为 16 岁者。年龄存储在变量 ridageyr 中。
  • 加载 simputation。使用 impute_median()riagendr 分组,为 nhanes_filterbmxwt 的缺失观测进行插补。
  • 重新编码变量 nhanes_final$mcq365d,将取值为 9 的观测改为 2。使用 count() 验证重编码是否生效。

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Filter to keep only those 16+
nhanes_filter <- ___ %>% filter(___)

# Load simputation & impute bmxwt by riagendr
___
nhanes_final <- impute_median(___, ___)

# Recode mcq365d with recode() & examine with count()
nhanes_final$mcq365d <- recode(nhanes_final$mcq365d, 
                               `1` = 1,
                               `2` = 2,
                               `9` = ___)
___ %>% ___
编辑并运行代码