การกรองข้อมูลซ้ำ
data table heart_2 และ cardio_2 ที่กรองค่าที่หายไปแล้วพร้อมใช้งานใน workspace ของคุณ เป้าหมายคือเลือก probe ตัวแทนหนึ่งตัวต่อยีนในแต่ละ data.table เพื่อให้แต่ละยีนมีเพียงรายการเดียวในผลลัพธ์ของการ join โดยต้องการเลือก probe ที่มีความสัมพันธ์อ่อนที่สุด เพื่อให้ได้ค่าประมาณความสามารถในการทำซ้ำแบบอนุรักษ์นิยม คอลัมน์ "change" เก็บค่า fold change ของระดับการแสดงออกของยีนสำหรับแต่ละ probe ระหว่างกลุ่มที่มีสุขภาพดีและกลุ่มที่เป็นโรคหัวใจ* ส่วนคอลัมน์ "pvalue" เก็บค่า p-value ของความแข็งแกร่งของความสัมพันธ์ โดยแถวเรียงลำดับตามความแข็งแกร่งของความสัมพันธ์จากมากไปน้อย (ค่า P-value จากน้อยไปมาก)
* หมายเหตุ: ค่าความสัมพันธ์เหล่านี้สร้างขึ้นแบบสุ่ม ไม่ได้สะท้อนผลการค้นพบทางชีววิทยาจริงหรือชุดข้อมูลจริงแต่อย่างใด
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
การ Join ข้อมูลด้วย data.table ใน R
คำแนะนำการฝึกหัด
- ใช้ฟังก์ชัน
unique()(docs) เพื่อลบรายการซ้ำในคอลัมน์"gene"ของทั้งheart_2และcardio_2โดยเก็บเฉพาะแถว สุดท้าย ของแต่ละยีน - Inner join
cardio_3เข้ากับheart_3โดยใช้ฟังก์ชันmerge()และต่อท้ายด้วย suffix".heart"และ".cardio"ที่คอลัมน์"change"และ"pvalue"
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Keep only the last probe for each gene
heart_3 <- ___
cardio_3 <- ___
# Inner join
reproducible <- ___(heart_3, cardio_3, by = "gene", ___)
reproducible