ÎncepețiÎncepe gratuit

Creează propriul grafic al frecvenței nucleotidelor

Acum este momentul să analizezi mai îndeaproape frecvența nucleotidelor pe ciclu. Cel mai bun mod de a face asta este printr-o vizualizare. De obicei, primele cicluri sunt puțin aleatorii, după care frecvența nucleotidelor ar trebui să se stabilizeze pe parcursul ciclurilor următoare.

Acest exercițiu folosește fișierul fastq complet SRR1971253, cu o preprocesare realizată în prealabil pentru tine:

library(ShortRead)
fqsample <- readFastq(dirPath = "data", 
                      pattern = "SRR1971253.fastq")
# extract reads                      
abc <- alphabetByCycle(sread(fqsample))

# Transpose nucleotides A, C, G, T per column
nucByCycle <- t(abc[1:4,]) 

# Tidy dataset
nucByCycle <- nucByCycle %>% 
  as_tibble() %>% # convert to tibble
  mutate(cycle = 1:50) # add cycle numbers

Sarcina ta este să creezi un grafic al Frecvenței Nucleotidelor pe Ciclu folosind funcțiile din tidyverse!

Acest exercițiu face parte din cursul

Introducere în Bioconductor în R

Vezi cursul

Instrucțiuni pentru exercițiu

  • Aplică glimpse() pe obiectul nucByCycle pentru a obține o imagine de ansamblu asupra datelor.
  • Transformă literele nucleotidelor în coloana alphabet folosind pivot_longer() și obține o nouă coloană count.
  • Creează un grafic de tip linie cu cycle pe axa x și count pe axa y, colorat în funcție de alphabet.

Exercițiu interactiv practic

Încearcă acest exercițiu completând acest cod de exemplu.

# Glimpse nucByCycle
___

# Create a line plot of cycle vs. count
nucByCycle %>% 
  # Gather the nucleotide letters in alphabet and get a new count column
  pivot_longer(-cycle, names_to = ___, values_to = ___) %>% 
  ggplot(aes(x = ___, y =  ___, color = ___)) +
  geom_line(size = 0.5 ) +
  labs(y = "Frequency") +
  theme_bw() +
  theme(panel.grid.major.x = element_blank())
Editează și rulează codul