Данные секвенирования
Базовой единицей набора данных ChIP-seq является рид секвенирования. Полный набор данных, как правило, включает несколько миллионов ридов, хранящихся в BAM-файлах. В этом упражнении мы рассмотрим, как риды представлены в R, на примере данных из небольшого участка хромосомы 20.
Риды уже загружены в R. Они хранятся в объекте GAlignments с именем reads. Объект GAlignments тесно связан с GenomicRanges, с которым вы, возможно, уже встречались в вводных курсах по Bioconductor. Это хорошая возможность вспомнить, как работать с объектами такого типа.
Напомним, что Bioconductor предоставляет функции-аксессоры для удобного извлечения данных. Например, start() возвращает начальные координаты всех ридов.
Это упражнение является частью курса
ChIP-seq с Bioconductor в R
Инструкции к упражнению
- Выведите объект
reads, чтобы получить сводку данных. - Получите начальную позицию первого рида.
- Получите конечную позицию последнего рида.
- Определите количество ридов, перекрывающих каждую позицию в выбранном регионе, то есть вычислите покрытие ридами с помощью одноимённой функции.
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Print the 'reads' object to obtain a summary of the data
print(___)
# Get the *start* position of the first read
start_first <- ___(reads)[1]
# Get the *end* position of the last read
end_last <- ___(___)[length(___)]
# Compute the number of reads covering each position in the selected region
cvg <- ___