Zacznij terazZacznij za darmo

Dane sekwencjonowania

Podstawową jednostką zbioru danych ChIP-seq jest odczyt sekwencjonowania. Kompletny zbiór danych zazwyczaj zawiera kilka milionów odczytów przechowywanych w plikach BAM. W tym ćwiczeniu przyjrzymy się, jak odczyty są reprezentowane w R – na przykładzie odczytów z niewielkiego fragmentu chromosomu 20.

Odczyty zostały już wczytane do R. Są przechowywane w obiekcie GAlignments o nazwie reads. Obiekt GAlignments jest ściśle powiązany z GenomicRanges, który mógł pojawić się podczas wstępnych kursów dotyczących Bioconductor. To dobra okazja, by przypomnieć sobie, jak pracować z tym typem obiektu.

Pamiętaj, że Bioconductor udostępnia funkcje akcesorowe ułatwiające wyodrębnianie danych. Na przykład start() zwraca współrzędne początku wszystkich odczytów.

To ćwiczenie jest częścią kursu

ChIP-seq z Bioconductor w R

Zobacz kurs

Instrukcje do ćwiczenia

  • Wyświetl obiekt reads, aby uzyskać podsumowanie danych.
  • Pobierz pozycję startową pierwszego odczytu.
  • Pobierz pozycję końcową ostatniego odczytu.
  • Wyznacz liczbę odczytów pokrywających każdą pozycję w wybranym regionie, czyli oblicz pokrycie odczytów, korzystając z funkcji o tej samej nazwie.

Interaktywne ćwiczenie praktyczne

Spróbuj tego ćwiczenia, uzupełniając ten przykładowy kod.

# Print the 'reads' object to obtain a summary of the data
print(___)

# Get the *start* position of the first read
start_first <- ___(reads)[1]

# Get the *end* position of the last read
end_last <- ___(___)[length(___)]

# Compute the number of reads covering each position in the selected region
cvg <- ___
Edytuj i uruchom kod