Data ze sekvenování
Základní jednotkou ChIP-seq datasetu je sekvenační čtení (read). Kompletní dataset obvykle obsahuje několik milionů čtení uložených v souborech BAM. V tomto cvičení se podíváme na to, jak jsou čtení reprezentována v R – použijeme čtení z malé oblasti na chromozomu 20.
Čtení jsou již načtena do R. Jsou uložena v objektu GAlignments s názvem reads. Objekt GAlignments úzce souvisí s GenomicRanges, se kterým ses možná setkal/a v úvodních kurzech Bioconductoru. Je to skvělá příležitost, jak si připomenout práci s tímto typem objektu.
Měj na paměti, že Bioconductor nabízí přístupové funkce (accessor functions), které usnadňují extrakci dat. Například start() vrátí počáteční souřadnice všech čtení.
Toto cvičení je součástí kurzu
ChIP-seq s Bioconductor v R
Pokyny k cvičení
- Vypiš objekt
reads, abys získal/a přehled o datech. - Zjisti počáteční pozici prvního čtení.
- Zjisti koncovou pozici posledního čtení.
- Urči počet čtení pokrývajících každou pozici ve vybrané oblasti, tedy vypočítej pokrytí (coverage) pomocí funkce stejného názvu.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Print the 'reads' object to obtain a summary of the data
print(___)
# Get the *start* position of the first read
start_first <- ___(reads)[1]
# Get the *end* position of the last read
end_last <- ___(___)[length(___)]
# Compute the number of reads covering each position in the selected region
cvg <- ___