篩選重複值
你已經在工作空間中擁有為缺失值過濾後的 heart_2 與 cardio_2 資料表。你的目標是,在每個 data.table 中為每個基因只保留一個具代表性的探針(probe),讓每個基因在連接結果中只出現一次。你想選擇關聯性最弱的探針,以取得較保守的可再現性估計。"change" 欄位包含健康受試者與心臟疾病受試者之間,每個探針的表現量倍數變化。"pvalue" 欄位則是關聯強度的 p 值。資料列依關聯強度由強到弱排序(也就是 p 值由小到大)。
* 注意:這些關聯是隨機產生的,並不代表任何真實的生物學發現或實際資料集。
本練習屬於課程
R 的 data.table 資料合併
練習說明
- 使用
unique()(文件)在heart_2與cardio_2中移除"gene"欄位的重複項。每個基因只保留「最後一列」。 - 使用
merge()將cardio_3與heart_3做內連接(inner join)。將".heart"與".cardio"作為"change"與"pvalue"欄位的後綴。
動手互動練習
試著完成這個範例程式碼,體驗一下這個練習。
# Keep only the last probe for each gene
heart_3 <- ___
cardio_3 <- ___
# Inner join
reproducible <- ___(heart_3, cardio_3, by = "gene", ___)
reproducible