การกรอง reads
ในแบบฝึกหัดนี้ จะทำความสะอาดข้อมูลเพิ่มเติมด้วยการลบ reads ที่มีคุณภาพการจัดเรียงต่ำออก โดยต้องโหลดค่าคุณภาพการจัดเรียง (alignment quality) จากไฟล์ BAM ก่อน ซึ่งข้อมูลนี้เก็บอยู่ในฟิลด์ mapq
แบบฝึกหัดนี้เป็นส่วนหนึ่งของหลักสูตร
ChIP-seq with Bioconductor in R
คำแนะนำการฝึกหัด
- โหลด
readsพร้อมข้อมูลคุณภาพการจัดเรียงที่แนบมากับแต่ละ read - ระบุ alignment ทั้งหมดที่มีค่าคุณภาพอย่างน้อย 20
- สร้าง boxplot เพื่อเปรียบเทียบการกระจายของค่าคุณภาพการจัดเรียงระหว่างกลุ่มคุณภาพสูงและต่ำ
- ลบ alignment ที่มีคุณภาพต่ำทั้งหมดออก
แบบฝึกหัดเชิงโต้ตอบแบบลงมือทำ
ลองทำแบบฝึกหัดนี้โดยเติมโค้ดตัวอย่างนี้ให้สมบูรณ์
# Load reads with mapping qualities by requesting the "mapq" entries
reads <- readGAlignments(bam_file, param=ScanBamParam(what=___))
# Identify good quality alignments
high_mapq <- mcols(reads)$mapq >= ___
# Examine mapping quality distribution for high and low quality alignments
___(mcols(reads)$mapq ~ high_mapq, xlab="good quality alignments", ylab="mapping quality")
# Remove low quality alignments
reads_good <- subset(reads, ___)