अपना खुद का nucleotide frequency प्लॉट आज़माएँ
अब समय है कि आप प्रति cycle nucleotide की frequency को क़रीब से देखें. इसका सबसे अच्छा तरीका है एक visualization बनाना. आम तौर पर शुरुआती cycles थोड़े रैंडम होते हैं, और फिर आगे के cycles के साथ nucleotide की frequency स्थिर हो जानी चाहिए.
यह अभ्यास पूरे fastq फ़ाइल SRR1971253 का उपयोग करता है, जिसमें आपके लिए कुछ pre-processing कर दी गई है:
library(ShortRead)
fqsample <- readFastq(dirPath = "data",
pattern = "SRR1971253.fastq")
# extract reads
abc <- alphabetByCycle(sread(fqsample))
# Transpose nucleotides A, C, G, T per column
nucByCycle <- t(abc[1:4,])
# Tidy dataset
nucByCycle <- nucByCycle %>%
as_tibble() %>% # convert to tibble
mutate(cycle = 1:50) # add cycle numbers
आपका कार्य है tidyverse फंक्शंस का उपयोग करके Nucleotide Frequency by Cycle का प्लॉट बनाना!
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Bioconductor परिचय
अभ्यास निर्देश
nucByCycleऑब्जेक्ट परglimpse()चलाकर डेटा का एक ओवरव्यू लें.pivot_longer()का उपयोग करकेalphabetमें मौजूद nucleotide अक्षरों को pivot करें और एक नयाcountकॉलम पाएँ.cycleको x-axis पर औरcountको y-axis पर रखते हुए,alphabetके आधार पर रंगीन line प्लॉट बनाएँ.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Glimpse nucByCycle
___
# Create a line plot of cycle vs. count
nucByCycle %>%
# Gather the nucleotide letters in alphabet and get a new count column
pivot_longer(-cycle, names_to = ___, values_to = ___) %>%
ggplot(aes(x = ___, y = ___, color = ___)) +
geom_line(size = 0.5 ) +
labs(y = "Frequency") +
theme_bw() +
theme(panel.grid.major.x = element_blank())