Результаты DE-анализа
После изучения PCA и тепловой карты корреляций мы обнаружили хорошую кластеризацию образцов по PC1, которая, по всей видимости, отражает вариацию данных, связанную с фиброзом, и по PC2, которая, судя по всему, отражает вариацию, обусловленную сверхэкспрессией smoc2. Дополнительных источников вариации и выбросов, требующих удаления, выявлено не было. Поэтому мы можем перейти к запуску DESeq2, тестированию дифференциальной экспрессии и сжатию значений кратного изменения. Все эти шаги были выполнены заранее, и итоговые результаты доступны в объекте res_all.
В этом упражнении вам нужно отобрать значимые гены из результатов и вывести топ-10 DE-генов по скорректированному p-значению.
Это упражнение является частью курса
RNA-Seq с Bioconductor в R
Инструкции к упражнению
Используйте функцию
subset(), чтобы извлечь значения со скорректированным p-значением менее 0,05. Сохраните результат фильтрации в виде датафрейма с именемsmoc2_sig, применив функциюdata.frame()и преобразовав названия строк в столбецgeneIDс помощью функцииrownames_to_column().Отсортируйте значимые результаты по скорректированным p-значениям с помощью функции
arrange(), выберите столбцы с идентификаторами генов Ensembl и скорректированными p-значениями, а затем выведите топ значимых генов с помощьюhead().
Интерактивное практическое упражнение
Попробуйте выполнить это упражнение, дополнив этот пример кода.
# Select significant genese with padj < 0.05
smoc2_sig <- subset(___, ___) %>%
___() %>%
___(var = ___)
# Extract the top 6 genes with padj values
smoc2_sig %>%
___(___) %>%
select(___, ___) %>%
head()