Creează propriul grafic al frecvenței nucleotidelor
Acum este momentul să analizezi mai îndeaproape frecvența nucleotidelor pe ciclu. Cel mai bun mod de a face asta este printr-o vizualizare. De obicei, primele cicluri sunt puțin aleatorii, după care frecvența nucleotidelor ar trebui să se stabilizeze pe parcursul ciclurilor următoare.
Acest exercițiu folosește fișierul fastq complet SRR1971253, cu o preprocesare realizată în prealabil pentru tine:
library(ShortRead)
fqsample <- readFastq(dirPath = "data",
pattern = "SRR1971253.fastq")
# extract reads
abc <- alphabetByCycle(sread(fqsample))
# Transpose nucleotides A, C, G, T per column
nucByCycle <- t(abc[1:4,])
# Tidy dataset
nucByCycle <- nucByCycle %>%
as_tibble() %>% # convert to tibble
mutate(cycle = 1:50) # add cycle numbers
Sarcina ta este să creezi un grafic al Frecvenței Nucleotidelor pe Ciclu folosind funcțiile din tidyverse!
Acest exercițiu face parte din cursul
Introducere în Bioconductor în R
Instrucțiuni pentru exercițiu
- Aplică
glimpse()pe obiectulnucByCyclepentru a obține o imagine de ansamblu asupra datelor. - Transformă literele nucleotidelor în coloana
alphabetfolosindpivot_longer()și obține o nouă coloanăcount. - Creează un grafic de tip linie cu
cyclepe axa x șicountpe axa y, colorat în funcție dealphabet.
Exercițiu interactiv practic
Încearcă acest exercițiu completând acest cod de exemplu.
# Glimpse nucByCycle
___
# Create a line plot of cycle vs. count
nucByCycle %>%
# Gather the nucleotide letters in alphabet and get a new count column
pivot_longer(-cycle, names_to = ___, values_to = ___) %>%
ggplot(aes(x = ___, y = ___, color = ___)) +
geom_line(size = 0.5 ) +
labs(y = "Frequency") +
theme_bw() +
theme(panel.grid.major.x = element_blank())