or
本练习是课程的一部分
在本章中,您将上手使用 Bioconductor。Bioconductor 是由 R 社区开发和维护的生物信息学软件专用仓库。您将学习如何安装和使用 Bioconductor 包。由于 Bioconductor 中的大多数包都继承自 S4,您还会接触 S4 对象与函数。此外,您将使用一种真菌的真实基因组数据集来探索 BSgenome 包。
Biostrings 是内存高效的字符串容器。Biostrings 提供匹配算法与其他工具,可对大型生物序列或序列集进行快速处理。为序列选择合适的容器,效率能提升到什么程度?您将借助一种病毒的微小基因组,学习字母表与序列操作。
IRanges 和 GenomicRanges 也是用于存储与操作基因组区间及沿基因组定义变量的容器。由于其强大的功能,这些包为许多其他 Bioconductor 包提供基础设施与支持。您将学习如何使用这些容器及其关联的元数据来操作您的序列。您将查看的数据集来自人类基因组中的一个重点关注基因。
当前练习
ShortRead 是用于读取、处理与评估 fasta 和 fastq 文件的包。您可以对子序列进行子集化、裁剪和过滤,甚至生成质量报告。在最后的练习中还有额外加分内容:使用 Rqc 进行并行质量评估。更有趣的是,您将以植物基因组序列为素材!