Sequenzierdaten
Die Grundeinheit eines ChIP-seq-Datensatzes ist ein Sequenzier-Read. Ein vollständiger Datensatz besteht typischerweise aus mehreren Millionen Reads, die in BAM-Dateien gespeichert sind. In dieser Übung schauen wir uns an, wie Reads in R dargestellt werden, und verwenden dafür Reads aus einem kleinen Abschnitt auf Chromosom 20.
Die Reads wurden bereits für dich in R geladen. Sie sind in einem GAlignments-Objekt namens reads gespeichert. Das GAlignments-Objekt ist eng mit GenomicRanges verwandt, das dir in einführenden Bioconductor-Kursen begegnet sein könnte. Das ist eine gute Gelegenheit, dir noch einmal in Erinnerung zu rufen, wie du mit diesem Objekttyp arbeitest.
Denk daran, dass Bioconductor Accessor-Funktionen bereitstellt, die das Extrahieren von Daten erleichtern. Zum Beispiel extrahiert start() die Startkoordinaten aller Reads.
Diese Übung ist Teil des Kurses
<Kurs>ChIP-seq mit Bioconductor in R</Kurs>Übungsanweisungen
- Gib das Objekt
readsaus, um eine Zusammenfassung der Daten zu erhalten. - Ermittle die Startposition des ersten Reads.
- Ermittle die Endposition des letzten Reads.
- Bestimme, wie viele Reads jede Position im ausgewählten Bereich abdecken, d. h. berechne die Read-Coverage mit der gleichnamigen Funktion.
Interaktive praktische Übung
Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.
# Print the 'reads' object to obtain a summary of the data
print(___)
# Get the *start* position of the first read
start_first <- ___(reads)[1]
# Get the *end* position of the last read
end_last <- ___(___)[length(___)]
# Compute the number of reads covering each position in the selected region
cvg <- ___