ข้อมูลการ Sequencing
หน่วยพื้นฐานของชุดข้อมูล ChIP-seq คือ sequencing read โดยทั่วไปชุดข้อมูลเต็มรูปแบบจะประกอบด้วย reads หลายล้านรายการ ซึ่งจัดเก็บอยู่ในไฟล์ BAM ในแบบฝึกหัดนี้ เราจะมาดูว่า reads ถูกแทนค่าอย่างไรใน R โดยใช้ reads จากบริเวณขนาดเล็กบนโครโมโซม 20
ข้อมูล reads ถูกโหลดเข้า R ให้แล้ว และถูกจัดเก็บในออบเจกต์ GAlignments ชื่อ reads ออบเจกต์ GAlignments มีความเกี่ยวข้องอย่างใกล้ชิดกับ GenomicRanges ซึ่งอาจเคยพบมาแล้วในคอร์ส Bioconductor เบื้องต้น นี่เป็นโอกาสดีที่จะทบทวนวิธีการทำงานกับออบเจกต์ประเภทนี้
จำไว้ว่า Bioconductor มีฟังก์ชัน accessor เพื่อให้การดึงข้อมูลทำได้ง่ายขึ้น ตัวอย่างเช่น start() จะดึงค่าพิกัดเริ่มต้นของ reads ทั้งหมด
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ChIP-seq with Bioconductor in R
คำแนะนำการฝึกหัด
- พิมพ์ออบเจกต์
readsเพื่อดูข้อมูลสรุปของข้อมูล - ดึงตำแหน่งเริ่มต้นของ read แรก
- ดึงตำแหน่งสิ้นสุดของ read สุดท้าย
- หาจำนวน reads ที่ครอบคลุมแต่ละตำแหน่งในบริเวณที่เลือก กล่าวคือ คำนวณค่า coverage ของ reads โดยใช้ฟังก์ชันที่มีชื่อเดียวกัน
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Print the 'reads' object to obtain a summary of the data
print(___)
# Get the *start* position of the first read
start_first <- ___(reads)[1]
# Get the *end* position of the last read
end_last <- ___(___)[length(___)]
# Compute the number of reads covering each position in the selected region
cvg <- ___