筛除重复项
您在工作区中可以使用之前按缺失值筛选得到的 heart_2 和 cardio_2 数据表。您的目标是:在每个 data.table 中为每个基因仅选择一个具有代表性的探针,这样在连接结果中每个基因只出现一条记录。为了得到更保守的可重复性估计,您希望选择与表型关联最弱的探针。列 "change" 表示在健康受试者与心脏病受试者之间,每个探针的表达水平倍数变化。列 "pvalue" 表示关联强度的 p 值。行已按关联强度从强到弱排序(即按 P 值从小到大排序)。
* 注:上述关联是随机生成的,不代表任何真实的生物学发现或真实数据集。
本练习是课程的一部分
在 R 中使用 data.table 进行数据表连接
练习说明
- 使用
unique()(文档)在heart_2和cardio_2中去除"gene"列的重复条目。仅保留每个基因的「最后一行」。 - 使用
merge()函数将cardio_3与heart_3做内连接。为"change"和"pvalue"列追加后缀".heart"和".cardio"。
交互式实操练习
通过完成这段示例代码来试试这个练习。
# Keep only the last probe for each gene
heart_3 <- ___
cardio_3 <- ___
# Inner join
reproducible <- ___(heart_3, cardio_3, by = "gene", ___)
reproducible