Sequencing-gegevens
De basiseenheid van een ChIP-seq-gegevensset is een sequencing read. Een volledige gegevensset bestaat meestal uit enkele miljoenen reads, opgeslagen in BAM-bestanden. In deze oefening bekijken we hoe reads in R worden weergegeven, met reads uit een klein gebied op chromosoom 20.
De reads zijn al voor je in R geladen. Ze staan in een GAlignments-object met de naam reads. Het GAlignments-object is nauw verwant aan GenomicRanges, dat je misschien al bent tegengekomen in inleidende Bioconductor-cursussen. Dit is een goed moment om jezelf eraan te herinneren hoe je met dit type object werkt.
Vergeet niet dat Bioconductor accessor-functies biedt om het ophalen van gegevens makkelijker te maken. Zo haalt start() de startcoördinaten van alle reads op.
Deze oefening maakt deel uit van de cursus
ChIP-seq met Bioconductor in R
Oefeninstructies
- Print het
reads-object om een samenvatting van de gegevens te krijgen. - Haal de startpositie van de eerste read op.
- Haal de eindpositie van de laatste read op.
- Bepaal het aantal reads dat elke positie in het geselecteerde gebied dekt, m.a.w. bereken de read-coverage met de functie met dezelfde naam.
Interactieve oefening met praktijkervaring
Probeer deze oefening door deze voorbeeldcode aan te vullen.
# Print the 'reads' object to obtain a summary of the data
print(___)
# Get the *start* position of the first read
start_first <- ___(reads)[1]
# Get the *end* position of the last read
end_last <- ___(___)[length(___)]
# Compute the number of reads covering each position in the selected region
cvg <- ___