LoslegenKostenlos starten

Sequenzierdaten

Die Grundeinheit eines ChIP-seq-Datensatzes ist ein Sequenzier-Read. Ein vollständiger Datensatz besteht typischerweise aus mehreren Millionen Reads, die in BAM-Dateien gespeichert sind. In dieser Übung schauen wir uns an, wie Reads in R dargestellt werden, und verwenden dafür Reads aus einem kleinen Abschnitt auf Chromosom 20.

Die Reads wurden bereits für dich in R geladen. Sie sind in einem GAlignments-Objekt namens reads gespeichert. Das GAlignments-Objekt ist eng mit GenomicRanges verwandt, das dir in einführenden Bioconductor-Kursen begegnet sein könnte. Das ist eine gute Gelegenheit, dir noch einmal in Erinnerung zu rufen, wie du mit diesem Objekttyp arbeitest.

Denk daran, dass Bioconductor Accessor-Funktionen bereitstellt, die das Extrahieren von Daten erleichtern. Zum Beispiel extrahiert start() die Startkoordinaten aller Reads.

Diese Übung ist Teil des Kurses

<Kurs>ChIP-seq mit Bioconductor in R</Kurs>
Kurs ansehen

Übungsanweisungen

  • Gib das Objekt reads aus, um eine Zusammenfassung der Daten zu erhalten.
  • Ermittle die Startposition des ersten Reads.
  • Ermittle die Endposition des letzten Reads.
  • Bestimme, wie viele Reads jede Position im ausgewählten Bereich abdecken, d. h. berechne die Read-Coverage mit der gleichnamigen Funktion.

Interaktive praktische Übung

Versuche dich an dieser Übung, indem du diesen Beispielcode vervollständigst.

# Print the 'reads' object to obtain a summary of the data
print(___)

# Get the *start* position of the first read
start_first <- ___(reads)[1]

# Get the *end* position of the last read
end_last <- ___(___)[length(___)]

# Compute the number of reads covering each position in the selected region
cvg <- ___
Code bearbeiten und ausführen