Kom igångKom igång gratis

Sekvensdata

Grundenheten i ett ChIP-seq-dataset är en sekvenseringsläsning. Ett fullständigt dataset består vanligtvis av flera miljoner läsningar, lagrade i BAM-filer. I den här övningen tittar vi på hur läsningar representeras i R, med hjälp av läsningar från ett litet område på kromosom 20.

Läsningarna har redan laddats in i R. De lagras i ett GAlignments-objekt som heter reads. GAlignments-objektet är nära besläktat med GenomicRanges, som du kanske känner igen från introduktionskurser i Bioconductor. Det här är ett bra tillfälle att påminna dig om hur du arbetar med den här typen av objekt.

Kom ihåg att Bioconductor tillhandahåller accessorfunktioner för att göra det enklare att extrahera data. Till exempel extraherar start() startkoordinaterna för alla läsningar.

Den här övningen är en del av kursen

ChIP-seq med Bioconductor i R

Visa kurs

Övningsinstruktioner

  • Skriv ut objektet reads för att få en sammanfattning av datan.
  • Hämta startpositionen för den första läsningen.
  • Hämta slutpositionen för den sista läsningen.
  • Bestäm antalet läsningar som täcker varje position i det valda området, det vill säga beräkna läsningens täckning med hjälp av funktionen med samma namn.

Interaktiv övning med praktiskt arbete

Testa den här övningen genom att slutföra den här exempelkoden.

# Print the 'reads' object to obtain a summary of the data
print(___)

# Get the *start* position of the first read
start_first <- ___(reads)[1]

# Get the *end* position of the last read
end_last <- ___(___)[length(___)]

# Compute the number of reads covering each position in the selected region
cvg <- ___
Redigera och kör kod