Données de séquençage
L'unité de base d'un jeu de données ChIP-seq est une lecture de séquençage. Un jeu de données complet comprend généralement plusieurs millions de lectures, stockées dans des fichiers BAM. Dans cet exercice, nous allons voir comment les lectures sont représentées en R, en utilisant des lectures provenant d'une petite région du chromosome 20.
Les lectures ont déjà été chargées dans R pour vous. Elles sont stockées dans un objet GAlignments nommé reads. L'objet GAlignments est étroitement lié à GenomicRanges, que vous avez peut-être vu dans des cours d'introduction à Bioconductor. C'est une bonne occasion de vous remémorer comment interagir avec ce type d'objet.
Rappelez-vous que Bioconductor fournit des fonctions d'accès qui facilitent l'extraction des données. Par exemple, start() extrait les coordonnées de début de toutes les lectures.
Cette activité fait partie du cours
ChIP-seq avec Bioconductor en R
Instructions de l’exercice
- Affichez l'objet
readspour obtenir un sommaire des données. - Récupérez la position de début de la première lecture.
- Récupérez la position de fin de la dernière lecture.
- Déterminez le nombre de lectures couvrant chaque position dans la région sélectionnée, c'est-à-dire calculez la couverture des lectures à l'aide de la fonction du même nom.
Exercice interactif pratique
Essayez cet exercice en complétant ce code d’exemple.
# Print the 'reads' object to obtain a summary of the data
print(___)
# Get the *start* position of the first read
start_first <- ___(reads)[1]
# Get the *end* position of the last read
end_last <- ___(___)[length(___)]
# Compute the number of reads covering each position in the selected region
cvg <- ___