Dane sekwencjonowania
Podstawową jednostką zbioru danych ChIP-seq jest odczyt sekwencjonowania. Kompletny zbiór danych zazwyczaj zawiera kilka milionów odczytów przechowywanych w plikach BAM. W tym ćwiczeniu przyjrzymy się, jak odczyty są reprezentowane w R – na przykładzie odczytów z niewielkiego fragmentu chromosomu 20.
Odczyty zostały już wczytane do R. Są przechowywane w obiekcie GAlignments o nazwie reads. Obiekt GAlignments jest ściśle powiązany z GenomicRanges, który mógł pojawić się podczas wstępnych kursów dotyczących Bioconductor. To dobra okazja, by przypomnieć sobie, jak pracować z tym typem obiektu.
Pamiętaj, że Bioconductor udostępnia funkcje akcesorowe ułatwiające wyodrębnianie danych. Na przykład start() zwraca współrzędne początku wszystkich odczytów.
To ćwiczenie jest częścią kursu
ChIP-seq z Bioconductor w R
Instrukcje do ćwiczenia
- Wyświetl obiekt
reads, aby uzyskać podsumowanie danych. - Pobierz pozycję startową pierwszego odczytu.
- Pobierz pozycję końcową ostatniego odczytu.
- Wyznacz liczbę odczytów pokrywających każdą pozycję w wybranym regionie, czyli oblicz pokrycie odczytów, korzystając z funkcji o tej samej nazwie.
Interaktywne ćwiczenie praktyczne
Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.
# Print the 'reads' object to obtain a summary of the data
print(___)
# Get the *start* position of the first read
start_first <- ___(reads)[1]
# Get the *end* position of the last read
end_last <- ___(___)[length(___)]
# Compute the number of reads covering each position in the selected region
cvg <- ___