Использование аннотаций
В этом упражнении вы будете работать с координатами генов, полученными из пакета TxDb.Hsapiens.UCSC.hg19.knownGene. Этот пакет содержит координаты всех известных генов человека. Объект GRanges с координатами и уникальными идентификаторами генов на хромосоме 20 уже загружен для вас под именем human_genes.
Идентификаторы удобны для технической работы с генами, однако их не всегда легко интерпретировать. Поэтому имеет смысл добавить более читаемые символы генов. Это можно сделать с помощью пакета org.Hs.eg.db, который предоставляет соответствия между различными системами идентификаторов генов. Функция select() позволяет получить символ гена, хранящийся в столбце SYMBOL, для каждого идентификатора. После извлечения этой информации её можно добавить в таблицу с координатами генов.
Это упражнение является частью курса
ChIP-seq с Bioconductor в R
Инструкции к упражнению
- Получите символы генов из столбца
SYMBOLпакета org.Hs.eg.db. - Изучите структуру полученных аннотаций.
- Добавьте символы генов в объект
human_genes. - Проверьте результат.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Obtain gene symbols
gene_symbol <- ___(org.Hs.eg.db, keys=human_genes$gene_id, columns="SYMBOL", keytype="ENTREZID")
# Examine the structure of the returned annotations
str(___)
# Add gene symbols to gene coordinates
human_genes$symbol <- ___
# Examine output
print(human_genes)