Začněte nyníZačněte zdarma

Data ze sekvenování

Základní jednotkou ChIP-seq datasetu je sekvenační čtení (read). Kompletní dataset obvykle obsahuje několik milionů čtení uložených v souborech BAM. V tomto cvičení se podíváme na to, jak jsou čtení reprezentována v R – použijeme čtení z malé oblasti na chromozomu 20.

Čtení jsou již načtena do R. Jsou uložena v objektu GAlignments s názvem reads. Objekt GAlignments úzce souvisí s GenomicRanges, se kterým ses možná setkal/a v úvodních kurzech Bioconductoru. Je to skvělá příležitost, jak si připomenout práci s tímto typem objektu.

Měj na paměti, že Bioconductor nabízí přístupové funkce (accessor functions), které usnadňují extrakci dat. Například start() vrátí počáteční souřadnice všech čtení.

Toto cvičení je součástí kurzu

ChIP-seq s Bioconductor v R

Zobrazit kurz

Pokyny k cvičení

  • Vypiš objekt reads, abys získal/a přehled o datech.
  • Zjisti počáteční pozici prvního čtení.
  • Zjisti koncovou pozici posledního čtení.
  • Urči počet čtení pokrývajících každou pozici ve vybrané oblasti, tedy vypočítej pokrytí (coverage) pomocí funkce stejného názvu.

Interaktivní cvičení na vyzkoušení si v praxi

Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.

# Print the 'reads' object to obtain a summary of the data
print(___)

# Get the *start* position of the first read
start_first <- ___(reads)[1]

# Get the *end* position of the last read
end_last <- ___(___)[length(___)]

# Compute the number of reads covering each position in the selected region
cvg <- ___
Upravit a spustit kód