Sekvensdata
Grundenheten i ett ChIP-seq-dataset är en sekvenseringsläsning. Ett fullständigt dataset består vanligtvis av flera miljoner läsningar, lagrade i BAM-filer. I den här övningen tittar vi på hur läsningar representeras i R, med hjälp av läsningar från ett litet område på kromosom 20.
Läsningarna har redan laddats in i R. De lagras i ett GAlignments-objekt som heter reads. GAlignments-objektet är nära besläktat med GenomicRanges, som du kanske känner igen från introduktionskurser i Bioconductor. Det här är ett bra tillfälle att påminna dig om hur du arbetar med den här typen av objekt.
Kom ihåg att Bioconductor tillhandahåller accessorfunktioner för att göra det enklare att extrahera data. Till exempel extraherar start() startkoordinaterna för alla läsningar.
Den här övningen är en del av kursen
ChIP-seq med Bioconductor i R
Övningsinstruktioner
- Skriv ut objektet
readsför att få en sammanfattning av datan. - Hämta startpositionen för den första läsningen.
- Hämta slutpositionen för den sista läsningen.
- Bestäm antalet läsningar som täcker varje position i det valda området, det vill säga beräkna läsningens täckning med hjälp av funktionen med samma namn.
Interaktiv övning med praktiskt arbete
Testa den här övningen genom att slutföra den här exempelkoden.
# Print the 'reads' object to obtain a summary of the data
print(___)
# Get the *start* position of the first read
start_first <- ___(reads)[1]
# Get the *end* position of the last read
end_last <- ___(___)[length(___)]
# Compute the number of reads covering each position in the selected region
cvg <- ___