शुरू करेंमुफ़्त में शुरू करें

Sequencing डेटा

ChIP-seq डेटासेट की बुनियादी इकाई एक sequencing read होती है. एक पूरा डेटासेट आम तौर पर कई मिलियन reads का होता है, जो BAM फ़ाइलों में स्टोर रहते हैं. इस अभ्यास में, हम देखेंगे कि R में reads को कैसे दर्शाया जाता है, इसके लिए हम क्रोमोसोम 20 के एक छोटे क्षेत्र के reads का उपयोग करेंगे.

आपके लिए reads पहले से ही R में लोड किए जा चुके हैं. ये reads नाम के GAlignments ऑब्जेक्ट में स्टोर हैं. GAlignments ऑब्जेक्ट का GenomicRanges से काफ़ी करीबी संबंध है, जिसे आप शुरुआती Bioconductor कोर्स के दौरान देख चुके होंगे. यह इस प्रकार के ऑब्जेक्ट के साथ इंटरैक्ट करना दोबारा याद करने का अच्छा अवसर है.

याद रखें कि Bioconductor डेटा निकालना आसान बनाने के लिए accessor फंक्शन्स प्रदान करता है. उदाहरण के लिए, start() सभी reads के start coordinates निकाल देगा.

यह अभ्यास पाठ्यक्रम का हिस्सा है

R में Bioconductor के साथ ChIP-seq

पाठ्यक्रम देखें

अभ्यास निर्देश

  • डेटा का सारांश प्राप्त करने के लिए reads ऑब्जेक्ट को प्रिंट करें.
  • पहले read की start पोज़िशन निकालें.
  • आख़िरी read की end पोज़िशन निकालें.
  • चुने गए क्षेत्र के प्रत्येक पोज़िशन को कवर करने वाले reads की संख्या निर्धारित करें, अर्थात् उसी नाम वाले फंक्शन से read coverage की गणना करें.

इंटरैक्टिव व्यावहारिक अभ्यास

इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।

# Print the 'reads' object to obtain a summary of the data
print(___)

# Get the *start* position of the first read
start_first <- ___(reads)[1]

# Get the *end* position of the last read
end_last <- ___(___)[length(___)]

# Compute the number of reads covering each position in the selected region
cvg <- ___
कोड संपादित करें और चलाएँ