เริ่มต้นใช้งานเริ่มต้นใช้งานได้ฟรี

การกรองข้อมูลซ้ำ

data table heart_2 และ cardio_2 ที่กรองค่าที่หายไปแล้วพร้อมใช้งานใน workspace ของคุณ เป้าหมายคือเลือก probe ตัวแทนหนึ่งตัวต่อยีนในแต่ละ data.table เพื่อให้แต่ละยีนมีเพียงรายการเดียวในผลลัพธ์ของการ join โดยต้องการเลือก probe ที่มีความสัมพันธ์อ่อนที่สุด เพื่อให้ได้ค่าประมาณความสามารถในการทำซ้ำแบบอนุรักษ์นิยม คอลัมน์ "change" เก็บค่า fold change ของระดับการแสดงออกของยีนสำหรับแต่ละ probe ระหว่างกลุ่มที่มีสุขภาพดีและกลุ่มที่เป็นโรคหัวใจ* ส่วนคอลัมน์ "pvalue" เก็บค่า p-value ของความแข็งแกร่งของความสัมพันธ์ โดยแถวเรียงลำดับตามความแข็งแกร่งของความสัมพันธ์จากมากไปน้อย (ค่า P-value จากน้อยไปมาก)

* หมายเหตุ: ค่าความสัมพันธ์เหล่านี้สร้างขึ้นแบบสุ่ม ไม่ได้สะท้อนผลการค้นพบทางชีววิทยาจริงหรือชุดข้อมูลจริงแต่อย่างใด

แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร

การ Join ข้อมูลด้วย data.table ใน R

ดูคอร์ส

คำแนะนำการฝึกหัด

  • ใช้ฟังก์ชัน unique() (docs) เพื่อลบรายการซ้ำในคอลัมน์ "gene" ของทั้ง heart_2 และ cardio_2 โดยเก็บเฉพาะแถว สุดท้าย ของแต่ละยีน
  • Inner join cardio_3 เข้ากับ heart_3 โดยใช้ฟังก์ชัน merge() และต่อท้ายด้วย suffix ".heart" และ ".cardio" ที่คอลัมน์ "change" และ "pvalue"

แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ

ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์

# Keep only the last probe for each gene
heart_3 <- ___
cardio_3 <- ___

# Inner join
reproducible <- ___(heart_3, cardio_3, by = "gene", ___)
reproducible
แก้ไขและรันโค้ด