НачатьНачать бесплатно

Данные секвенирования

Базовой единицей набора данных ChIP-seq является рид секвенирования. Полный набор данных, как правило, включает несколько миллионов ридов, хранящихся в BAM-файлах. В этом упражнении мы рассмотрим, как риды представлены в R, на примере данных из небольшого участка хромосомы 20.

Риды уже загружены в R. Они хранятся в объекте GAlignments с именем reads. Объект GAlignments тесно связан с GenomicRanges, с которым вы, возможно, уже встречались в вводных курсах по Bioconductor. Это хорошая возможность вспомнить, как работать с объектами такого типа.

Напомним, что Bioconductor предоставляет функции-аксессоры для удобного извлечения данных. Например, start() возвращает начальные координаты всех ридов.

Это упражнение является частью курса

ChIP-seq с Bioconductor в R

Посмотреть курс

Инструкции к упражнению

  • Выведите объект reads, чтобы получить сводку данных.
  • Получите начальную позицию первого рида.
  • Получите конечную позицию последнего рида.
  • Определите количество ридов, перекрывающих каждую позицию в выбранном регионе, то есть вычислите покрытие ридами с помощью одноимённой функции.

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Print the 'reads' object to obtain a summary of the data
print(___)

# Get the *start* position of the first read
start_first <- ___(reads)[1]

# Get the *end* position of the last read
end_last <- ___(___)[length(___)]

# Compute the number of reads covering each position in the selected region
cvg <- ___
Редактировать и запускать код