DE विश्लेषण के परिणाम
PCA और correlation heatmap की जाँच करने के बाद, हमें PC1 पर हमारे samples का अच्छा clustering मिला, जो fibrosis के कारण डेटा में होने वाले variation को दर्शाता लगा, और PC2 पर smoc2 overexpression के कारण variation दिखा. हमें डेटा में अन्य अतिरिक्त variation के स्रोत नहीं मिले और न ही कोई outliers हटाने थे. इसलिए, हम DESeq2 चलाने, DE testing करने, और fold changes को shrink करने की प्रक्रिया आगे बढ़ा सकते हैं. आपके लिए ये स्टेप्स पहले ही चलाए गए हैं ताकि अंतिम परिणाम res_all तैयार हो जाए.
इस अभ्यास में, हम परिणामों में से significant genes को subset करना चाहेंगे और adjusted p-value के आधार पर टॉप 10 DE genes को आउटपुट करेंगे.
यह अभ्यास पाठ्यक्रम का हिस्सा है
R में Bioconductor के साथ RNA-Seq
अभ्यास निर्देश
subset()फंक्शन का उपयोग करके वे मान निकालिए जिनका adjusted p-value 0.05 से कम है. इस subset कोdata.frame()फंक्शन का उपयोग करकेsmoc2_sigनाम के डेटा फ्रेम के रूप में सेव कीजिए, औरrownames_to_column()फंक्शन से row names कोgeneIDनाम के कॉलम में बदल दीजिए.arrange()फंक्शन से significant परिणामों को adjusted p-values के आधार पर क्रमबद्ध कीजिए, Ensembl gene ID और adjusted p-values वाले कॉलम चुनिए, औरhead()का उपयोग करके शीर्ष significant genes आउटपुट कीजिए.
इंटरैक्टिव व्यावहारिक अभ्यास
इस अभ्यास को इस नमूना कोड को पूरा करके आज़माएँ।
# Select significant genese with padj < 0.05
smoc2_sig <- subset(___, ___) %>%
___() %>%
___(var = ___)
# Extract the top 6 genes with padj values
smoc2_sig %>%
___(___) %>%
select(___, ___) %>%
head()