开始使用免费开始使用

筛除重复项

您在工作区中可以使用之前按缺失值筛选得到的 heart_2cardio_2 数据表。您的目标是:在每个 data.table 中为每个基因仅选择一个具有代表性的探针,这样在连接结果中每个基因只出现一条记录。为了得到更保守的可重复性估计,您希望选择与表型关联最弱的探针。列 "change" 表示在健康受试者与心脏病受试者之间,每个探针的表达水平倍数变化。列 "pvalue" 表示关联强度的 p 值。行已按关联强度从强到弱排序(即按 P 值从小到大排序)。

* 注:上述关联是随机生成的,不代表任何真实的生物学发现或真实数据集。

本练习是课程的一部分

在 R 中使用 data.table 进行数据表连接

查看课程

练习说明

  • 使用 unique()文档)在 heart_2cardio_2 中去除 "gene" 列的重复条目。仅保留每个基因的「最后一行」。
  • 使用 merge() 函数将 cardio_3heart_3 做内连接。为 "change""pvalue" 列追加后缀 ".heart"".cardio"

交互式实操练习

通过完成这段示例代码来试试这个练习。

# Keep only the last probe for each gene
heart_3 <- ___
cardio_3 <- ___

# Inner join
reproducible <- ___(heart_3, cardio_3, by = "gene", ___)
reproducible
编辑并运行代码