protal:基于比对的超快速宏基因组物种与菌株分辨分析谱工具
摘要
大规模宏基因组研究日益需要具备高灵敏度、高精度、菌株分辨能力且计算可行的分类学分析谱。现有分析谱工具通常在分类学广度、灵敏度、精度与速度之间相互权衡,限制了其在高分辨率微生物组分析中的应用。本研究提出protal(profiling through alignment,通过比对进行分析谱)——一种基于比对的超快速方法,用于对宏基因组进行物种水平与菌株水平分辨的分析谱。
protal 结合了新开发的比对算法、基于机器学习的分类器以及保守的细菌标记基因,对标准化且定期更新的GTDB(Genome Taxonomy Database)分类体系中收录的物种进行分析谱。protal 可靠地对 GTDB r226 中的全部143,614 个细菌与古菌物种进行谱分析,并在 CAMI2 基准测试中取得了高于所有受测当代分析谱工具的精度,包括 MetaPhlAn 4、mOTUs4、sylph 与 Kraken2+Bracken(物种水平平均精度98.3%,而次优工具 sylph 为 97.5%)。在定制化基准测试中,protal 在仅由单个参考基因组代表的稀有物种,以及包含 10,000 个物种的高度复杂群落中表现出尤为显著的提升(F1 值分别比次优工具高 9% 和 14%)。
由于 protal 保留了读段比对信息,其能够以可与 StrainPhlAn 4 相媲美的准确度,重建被检测细菌之间的种内系统发育关系。与专用的菌株分析谱流程不同,protal 在物种水平分析谱的同时进行菌株分析,从而无需额外步骤即可实现最高40 倍加速。上述特性使得在普通商用硬件上对成千上万份宏基因组进行菌株分辨分析谱成为可能。软件、数据库与教程可在 https://github.com/4less/protal 与 http://protal.earlham.ac.uk 获取。
Keywords: 分类学分析谱;菌株分辨分析;高通量;鸟枪法宏基因组学
文献信息
- Fritscher, J., Duncan, A., Hildebrand, F. (2026). Protal: profiling through alignment — a strain-resolved analysis.bioRxiv. Posted August 6, 2026. doi: https://doi.org/10.64898/2026.08.03.742433
- 载体:bioRxiv 预印本(未经同行评审)
- 作者单位:Quadram Institute Bioscience 食品、微生物与健康组;Earlham Institute;东英吉利大学
- 通讯作者:Falk Hildebrand(falk.hildebrand@quadram.ac.uk)
- 期刊与影响因子:本文为 bioRxiv 预印本,尚未检索到正式发表期刊及对应 IF 信息
- 软件与数据库:https://github.com/4less/protal;http://protal.earlham.ac.uk
研究总结
背景介绍
近年来,宏基因组组装与基因组分箱技术的快速发展,以及公开测序数据的迅速积累,极大扩展了以 GTDB 为代表的参考基因组数据库的分类多样性。组装驱动的方法虽可提供高分辨率的微生物群落特征,但在大规模分析中计算代价高昂,且难以恢复低丰度分类群。相比之下,基于参考的分类学分析谱提供了一种互补思路,它充分利用来自分离基因组与宏基因组组装基因组的扩展参考数据库,具有更高的计算效率以及对低丰度分类群更高的灵敏度,因此特别适用于人类肠道等已被充分表征的微生物组、含有大量低丰度分类群的复杂微生物群落,以及大规模数据集。
当前的基于参考的分析谱工具通常依赖系统发育信息标记基因(如 MetaPhlAn 4、mOTUs4),或依赖基因组特异性 k-mer 的累计计数作为物种存在证据(如 Kraken2、sylph)。尽管菌株水平变异的生物学重要性日益得到认可,多数分类学分析谱工具仍主要优化于物种水平的推断。菌株水平分析通常需要独立的下游流程——如 MetaPhlAn 4 的 StrainPhlAn 4、mOTUs4 的 metaSNV——这增加了计算复杂性并限制了可扩展性。
为应对学界对于快速、高分辨且精确的宏基因组分析谱工具的需求,作者推出了 protal。该工具引入了一个具有系统发育意识的、利用独特 GTDB 标记基因来联合推断分类组成与菌株关系的比对框架,其核心是一种新开发的比对算法,比当代比对器更精确也更快速。protal 的关键特征包括:完全兼容 GTDB 数据库及其更新;对仅有一个可用参考基因组的物种也能稳健表征;进化准确的菌株水平系统发育;比同类工具快一到两个数量级的分析谱速度。
重要结果
结果1:protal 实现、数据库覆盖度与比对性能
protal 以 C++ 编写实现,能够在集成、开源的框架内对宏基因组数据进行快速且内存高效的处理。使用 GTDB r226 时,protal 参考数据库代表了143,614 个物种(图 1a,b)。protal 使用通用的单拷贝基因作为参考,这些基因既支持准确的物种检测与丰度估计,也为菌株分辨分析提供保守的进化信号。基于 GTDB r226 构建时,protal、Kraken2 与 sylph 覆盖 143,614 个物种(29,405 个属与 5,932 个科),而 MetaPhlAn 4 与 mOTUs4 所代表的物种数仅为前者的一半或更少(图 1b)。这一差异至关重要,因为 GTDB r226 中65.5% 的物种仅由单个基因组代表;而 protal 使用通用的单拷贝标记基因,能够仅凭单个基因组对一个物种进行谱分析,无需逐物种地发现标记。
protal 使用一种基于精确 k-mer 匹配、采用 core-mer 与 flex-mer 的自定义比对算法,二者借助 syncmers 在内存中被压缩。候选标记基因随后由波前比对进行评估。在模拟读段的比对基准测试中,protal 在 MAPQ 5 时达到77.4% 的真阳性率与 3.0% 的假发现率;在 2×5 GB 输入读段的比对中耗时 5 分 52 秒,比 BWA-MEM2 快 2 倍以上,比 Bowtie2 快 3 倍以上,比 minimap2 快 4 倍以上(图 1d,e)。
Figure 1 图注:protal 工作流程、数据库覆盖度、比对策略与比对性能概览。(a) protal 分析谱与菌株分辨流程示意图;(b) 各分析谱工具基于 GTDB r226 的物种覆盖度对比;© core-mer 与 flex-mer 比对策略示意;(d) 不同比对器的真阳性率与假发现率;(e) 比对运行时间与内存占用对比。
结果2:protal 在物种水平分析中达到最高精度
作者在 9 个合成宏基因组基准数据集上对 protal 进行了评估,包括来自 5 个人体部位(气道、胃肠、口腔、皮肤、泌尿生殖)的 CAMI 数据集(n=49)、小鼠肠道(n=49)与海洋(n=9)群落,以及一个稀有物种基准(R.Sp.;n=20)和一个包含约 10,000 个物种的高复杂度宏基因组(n=20,图 2a)。protal 在所有数据集上均取得了最高的物种水平平均 F1 值(0.969±0.021)、灵敏度(0.956±0.031)与精度(0.983±0.026,图 2a)。sylph 是整体上最强的替代方案(F1=0.939±0.050)。
protal 的优势在更具挑战性的模拟中最为明显。在稀有物种基准中,protal 达到最高 F1 值(0.949±0.012)与灵敏度(0.919),优于 sylph(F1=0.863±0.019)、MetaPhlAn 4(F1=0.495±0.025)与 mOTUs4(F1=0.619±0.029)。在高复杂度宏基因组中,protal 保持了高灵敏度(0.963±0.002)与精度(0.998±0.000),F1 值达 0.980±0.001,而 sylph 为 0.843,Kraken2+Bracken 为 0.712,MetaPhlAn 4 为 0.382,mOTUs4 为 0.414。
protal 的预测物种丰度与期望丰度高度吻合,物种水平 Pearson 相关系数均值达 0.961±0.083(图 2b)。在 CAMI 小鼠数据集中,protal 可恢复相对丰度低至0.0004%的真阳性,低于 MetaPhlAn 4(0.0012%)与 sylph(0.0023%)的检测下限。随着群落复杂度增加,protal 是唯一假阳性计数与丰富度无关的 profiler(R=0.16,不显著),从而在高复杂度下保持了精度。
计算性能方面,在 10 个 CAMI 气道宏基因组的基准中,protal 完成基准耗时 19 分 45 秒,比 MetaPhlAn 4 快约 4.3 倍,比 mOTUs4 快约 4.1 倍;protal-mini 更快(17 分 52 秒),内存占用仅 12 GB(完整数据库为 59 GB)。
Figure 2 图注:宏基因组分类学分析谱工具的对比基准测试。(a) 各工具在九大基准数据集上的物种水平 F1、灵敏度与精度;(b) 预测与期望物种丰度的 Pearson 相关系数;© 配对 t 检验评估各工具在分类层级上的 F1 显著性优势;(d) 计算性能对比;(e) 随机森林特征重要性。
结果3:protal 以更短运行时间实现菌株分辨分析谱
protal 通过为每个在至少三个宏基因组中检测到的物种构建参考引导的标记基因多序列比对,进而使用 IQ-TREE 推断系统发育,从而实现种内系统发育解析。
在 STRAIN46 合成数据集(200 个宏基因组,46 个细菌物种)的基准测试中,protal 端到端比 MetaPhlAn 4 + StrainPhlAn 4 快6-40 倍(图 3a)。在 64 个样本时,protal 完成分析谱与菌株解析耗时 22 分钟,而 MetaPhlAn 4 + StrainPhlAn 4 耗时 7.9 小时;128 个样本时分别为 41 分钟与 11.8 小时。
在比对质量方面,protal 恢复的基因组中94.5% 无任何错配位点(平均每基因组 0.13 个错误),而 StrainPhlAn 4 仅 9.5% 无错配(平均 4.9 个错误)。由于 protal 默认保留恒定比对位置,其比对长度约为 StrainPhlAn 4 的 30 倍(每物种中位数 118 kb vs 4.0 kb),在每位点错误率上 protal 同样远低于 StrainPhlAn 4(2.5×10⁻⁶ vs 2.5×10⁻³)。
在菌株单系性(monophyly)方面,protal 与 StrainPhlAn 4 整体表现相当(0.868±0.244 vs 0.878±0.236;p=0.30)。在系统发育树相似性上,由于 protal 保留恒定位置,其树枝长度与全基因组参考在同一尺度上可比——protal 的树枝长度是金标准树的 0.64 倍,而 StrainPhlAn 4 的可变位点比对使树枝长度膨胀约 20 倍;protal 的树枝得分距离(branch-score distance)比 StrainPhlAn 4 近约50 倍(中位数 0.012 vs 0.580),树拓扑结构恢复程度两者相当。
Figure 3 图注:Protal 以更短的运行时间实现菌株分辨分析谱。(a) protal 与 MetaPhlAn 4 + StrainPhlAn 4 的端到端运行时间对比;(b) 按物种分层的每基因组比对错误数;© 标记基因多序列比对质量对比;(d) 菌株单系性随最近邻相似度变化;(e) 推断的系统发育树与金标准树的相似性指标。
方法学参考
本研究方法体系的核心创新与可借鉴之处包括:
- core-mer 与 flex-mer 双层 k-mer 策略:core-mer 为 31-mer 中央的 15-mer,用于精确查找;flex-mer 为中央 core-mer 两侧各 8 nt 组成的 16 nt 序列,用于对具有相同 core-mer 的候选匹配进行排序。二者存储于自定义的哈希数据结构 flex-map 中,记录标记基因位置、分类单元身份与 k-mer 唯一性信息。
- 随机森林物种判定:使用 512 棵树、最大 256 个叶节点的随机森林分类器,在 581 个合成宏基因组样本上训练,整合长唯一 k-mer 基因率、期望基因存在率、平均比对一致度与覆盖变异等特征进行物种存在判定。
- 参考引导多序列比对(RG-MSA):概念上类似于 ViralMSA,通过参考引导策略以线性运行时间随样本数扩展,实现高效菌株分辨。
- 多维度基准测试设计:包括基于 CAMI2 的标准基准、针对单基因组代表稀有物种的 R.Sp. 基准、万物种高复杂度模拟,以及包含 46 个物种的 STRAIN46 菌株解析基准,全面评估工具在灵敏度、精度、丰度估计与系统发育重建上的表现。
总结
protal 证明了基于比对的宏基因组分析谱可以被优化至适用于大规模研究的速度,同时保留菌株分辨分析所需的核苷酸信息。在合成基准测试中,protal 结合了完整的 GTDB 物种覆盖度、高物种水平精度与灵敏度、准确的丰度重建,以及比现有基于比对的分析谱工具显著更快的运行时间。
不同于纯粹的基于 k-mer 的方法,protal 同时为检测到的物种重建标记基因比对,从而在同一工作流程中实现种内系统发育的从头推断。这一定位使 protal 非常适用于需要同时进行物种水平分析谱与菌株追踪的大规模宏基因组集合。
protal 当前仍存在若干局限:首先,protal 目前不能在单个宏基因组内解析多个同种菌株,菌株分辨分析限于具有主导菌株信号的场景;其次,物种检测依赖于参考分类体系的质量,嵌合参考基因组、不精确的分类边界、水平基因转移与同源重组都会降低特异性;第三,protal 依赖通用标记基因,菌株比较基于约 5% 的基因组,这限制了其对仅有极少替代的菌株的分辨能力。此外,protal 目前仅限于原核物种与短读段宏基因组数据,未来版本将扩展至真核生物与长读段宏基因组数据。protal-mini 数据库(20 个标记基因)将内存占用降低约 5 倍(12 GB vs 59 GB),仅适度降低分析谱精度(F1 0.945 vs 0.969),使物种分析谱在笔记本电脑级硬件上成为可能。
参考文献
- Fritscher, J., Duncan, A., Hildebrand, F. (2026). Protal: profiling through alignment — a strain-resolved analysis.bioRxiv. doi: https://doi.org/10.64898/2026.08.03.742433
- Parks, D. H. et al. (2022). GTDB: an ongoing census of bacterial and archaeal diversity through a phylogenetically consistent, rank normalized and complete genome-based taxonomy.Nucleic Acids Research50, D785-D794.
- Blanco-Miguez, A. et al. (2023). Extending and improving metagenomic taxonomic profiling with uncharacterized species using MetaPhlAn 4.Nature Biotechnology.
- Shaw, J. & Yu, Y. W. (2024). Rapid species-level metagenome profiling and containment estimation with sylph.Nature Biotechnology.
- Wood, D. E., Lu, J. & Langmead, B. (2019). Improved metagenomic analysis with Kraken 2.Genome Biology20, 257.
- Meyer, F. et al. (2022). Critical Assessment of Metagenome Interpretation: the second round of challenges.Nature Methods19, 429-440.
- 软件与数据库:https://github.com/4less/protal;http://protal.earlham.ac.uk
