Práce s anotacemi
V tomto cvičení použiješ genové souřadnice získané z balíčku TxDb.Hsapiens.UCSC.hg19.knownGene. Tento balíček obsahuje souřadnice všech známých lidských genů. Objekt GRanges se souřadnicemi a jedinečnými ID genů na chromozomu 20 je pro tebe načten jako human_genes.
Tato ID jsou sice užitečná pro identifikaci genů, ale nejsou příliš intuitivní. Může být výhodné doplnit také čitelnější genové symboly. K tomu slouží balíček org.Hs.eg.db, který poskytuje mapování mezi různými sadami genových identifikátorů. Funkce select() ti umožní získat genový symbol uložený ve sloupci SYMBOL pro každé ID. Jakmile tyto informace extrahuješ, můžeš je přidat do tabulky genových lokací.
Toto cvičení je součástí kurzu
ChIP-seq s Bioconductor v R
Pokyny k cvičení
- Získej genové symboly ze sloupce
SYMBOLbalíčku org.Hs.eg.db. - Prozkoumej strukturu vrácených anotací.
- Přidej genové symboly do objektu
human_genes. - Prohlédni si výsledek.
Interaktivní cvičení na vyzkoušení si v praxi
Vyzkoušejte si toto cvičení dokončením tohoto ukázkového kódu.
# Obtain gene symbols
gene_symbol <- ___(org.Hs.eg.db, keys=human_genes$gene_id, columns="SYMBOL", keytype="ENTREZID")
# Examine the structure of the returned annotations
str(___)
# Add gene symbols to gene coordinates
human_genes$symbol <- ___
# Examine output
print(human_genes)