НачатьНачать бесплатно

Результаты DE-анализа

После изучения PCA и тепловой карты корреляций мы обнаружили хорошую кластеризацию образцов по PC1, которая, по всей видимости, отражает вариацию данных, связанную с фиброзом, и по PC2, которая, судя по всему, отражает вариацию, обусловленную сверхэкспрессией smoc2. Дополнительных источников вариации и выбросов, требующих удаления, выявлено не было. Поэтому мы можем перейти к запуску DESeq2, тестированию дифференциальной экспрессии и сжатию значений кратного изменения. Все эти шаги были выполнены заранее, и итоговые результаты доступны в объекте res_all.

В этом упражнении вам нужно отобрать значимые гены из результатов и вывести топ-10 DE-генов по скорректированному p-значению.

Это упражнение является частью курса

RNA-Seq с Bioconductor в R

Посмотреть курс

Инструкции к упражнению

  • Используйте функцию subset(), чтобы извлечь значения со скорректированным p-значением менее 0,05. Сохраните результат фильтрации в виде датафрейма с именем smoc2_sig, применив функцию data.frame() и преобразовав названия строк в столбец geneID с помощью функции rownames_to_column().

  • Отсортируйте значимые результаты по скорректированным p-значениям с помощью функции arrange(), выберите столбцы с идентификаторами генов Ensembl и скорректированными p-значениями, а затем выведите топ значимых генов с помощью head().

Интерактивное практическое упражнение

Попробуйте выполнить это упражнение, дополнив этот пример кода.

# Select significant genese with padj < 0.05
smoc2_sig <- subset(___, ___) %>%
  				___() %>%
  				___(var = ___)

# Extract the top 6 genes with padj values
smoc2_sig %>%
	___(___) %>%
	select(___, ___) %>%
	head()
Редактировать и запускать код