Дані секвенування
Базовою одиницею набору даних ChIP-seq є рід секвенування. Повний набір зазвичай містить кілька мільйонів рідів, що зберігаються у файлах BAM. У цій вправі ми розглянемо, як ріди подано в R, використовуючи ріди з невеликої ділянки хромосоми 20.
Ріди вже завантажено в R. Вони збережені в об'єкті GAlignments з назвою reads. Об'єкт GAlignments тісно пов'язаний із GenomicRanges, який ви могли бачити на вступних курсах Bioconductor. Це добра нагода пригадати, як працювати з таким типом об'єктів.
Пам'ятайте, що Bioconductor надає функції-доступники, які полегшують отримання даних. Наприклад, start() повертає початкові координати всіх рідів.
Ця вправа є частиною курсу
ChIP-seq з Bioconductor у R
Інструкції до вправи
- Виведіть об'єкт
reads, щоб отримати зведення про дані. - Отримайте початкову позицію першого ріда.
- Отримайте кінцеву позицію останнього ріда.
- Визначте, скільки рідів покриває кожну позицію у вибраній ділянці, тобто обчисліть coverage рідів за допомогою однойменної функції.
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Print the 'reads' object to obtain a summary of the data
print(___)
# Get the *start* position of the first read
start_first <- ___(reads)[1]
# Get the *end* position of the last read
end_last <- ___(___)[length(___)]
# Compute the number of reads covering each position in the selected region
cvg <- ___