Результати DE-аналізу
Після аналізу PCA та кореляційної теплової карти ми побачили чітке групування наших зразків за PC1, який, здається, відображає варіацію в даних через фіброз, і PC2, який, імовірно, відображає варіацію в даних через надекспресію smoc2. Додаткових джерел варіації чи викидів для видалення ми не виявили. Тому можемо переходити до запуску DESeq2, тестування на диференційовану експресію та зменшення fold change. Ми виконали ці кроки за вас, щоб отримати фінальні результати res_all.
У цій вправі потрібно вибрати з результатів значущі гени та вивести топ-10 DE-генів за скоригованим p-значенням.
Ця вправа є частиною курсу
RNA-Seq з Bioconductor у R
Інструкції до вправи
Використайте функцію
subset(), щоб вибрати значення зі скоригованим p-значенням менше ніж 0,05. Збережіть вибірку як датафреймsmoc2_sig, застосувавши функціюdata.frame()і перетворивши назви рядків на стовпецьgeneIDза допомогоюrownames_to_column().Впорядкуйте значущі результати за скоригованими p-значеннями за допомогою функції
arrange(), виберіть стовпці з Ensembl gene ID та скоригованими p-значеннями, і виведіть найзначущіші гени за допомогоюhead().
Інтерактивна практична вправа
Спробуйте виконати цю вправу, доповнивши цей зразок коду.
# Select significant genese with padj < 0.05
smoc2_sig <- subset(___, ___) %>%
___() %>%
___(var = ___)
# Extract the top 6 genes with padj values
smoc2_sig %>%
___(___) %>%
select(___, ___) %>%
head()