DRUGONE

靶向代谢组学和脂质组学通常采用液相色谱–质谱联用技术,通过多重反应监测(multiple reaction monitoring,MRM)定量几十到数百种目标分子。在人群研究和大型临床队列中,实验往往需要处理数百至数千个样本,此时真正的瓶颈不再只是仪器采集,而是如何快速、稳定并可重复地完成峰积分、定量、质量控制、批次校正和结果输出。研究人员开发了 MRMhub,一个面向大规模靶向LC–MS分析的自动化数据处理框架,由 INTEGRATOR 和 QUANT 两个可定制模块组成,可将原始MRM数据直接转换为经过质量控制的定量结果。


INTEGRATOR主要负责峰识别和积分,通过学习整个分析序列中同一分析物的动态色谱模式,处理保留时间漂移、峰边界变化和非随机干扰;QUANT则负责后采集定量和质量控制,包括数据完整性检查、异常值识别、内标归一化、校准曲线、漂移和批次效应校正、特征筛选以及报告生成。研究人员在多个真实靶向脂质组学和临床级定量数据集上验证了该框架。在包含937个样本的SPERFECT数据集和4,591个样本的DYNAMO数据集中,分别检测482和828个特征,在普通笔记本电脑上,完成原始数据格式转换之后,整个数据处理流程均可在约10分钟内完成。

靶向LC–MS在临床研究、流行病学、代谢组学和脂质组学中具有重要地位。与非靶向分析相比,MRM通常预先确定目标化合物、母离子–子离子转itions、保留时间窗口和内标,因而具有较高灵敏度、选择性和定量稳定性,特别适合在大型样本队列中测量一组明确的代谢物或脂质。


但当研究规模从几十个样本扩展到几千个样本后,传统半手工处理流程会迅速成为限制因素。一次大型MRM实验可能同时包含数百个离子转itions,并持续运行数周。即使仪器方法保持不变,色谱保留时间也会逐渐漂移,峰形可能发生变化,某些样本还可能受到基质效应、共洗脱干扰、仪器灵敏度变化或批次差异影响。如果研究人员逐个样本手动调整峰边界,不仅耗时巨大,也容易引入人为差异。


商业仪器软件通常能够完成基本峰积分和定量,但不同厂商的软件格式、功能和自动化程度差异明显,分析流程往往难以完整记录和复现。对于需要重新处理、修改质量控制参数或在不同研究中心之间共享方法的大规模研究,这种封闭工作流尤其不方便。


MRMhub试图解决的正是这一“规模化数据工程”问题:不是重新设计一种新的质谱采集技术,而是把从峰积分到最终可用于统计分析的数据表之间的步骤标准化、自动化和程序化,使靶向代谢组学能够更容易扩展到人群尺度。研究人员特别强调,自动化不仅意味着更快,还应同时保证质量控制透明、参数可追踪以及结果可重复。



方法

MRMhub由两个相互衔接的核心模块构成。首先,INTEGRATOR读取转换为mzML格式的原始MRM数据以及样本和特征元数据,对输入完整性进行检查,然后根据分析序列中的参考保留时间进行全局保留时间校正。模型不是独立处理每一个样本,而是跨样本识别同一分析物的色谱峰模式,通过共识方式确定候选峰、逐步优化峰边界,并完成最终积分。这种策略使峰识别能够适应长时间批量实验中的系统漂移和样本差异,同时保留交互式可视化界面,供研究人员快速检查和必要时调整结果。随后,QUANT接收积分后的数据,执行后采集处理和质量控制,包括数据完整性和全局分布检查、PCA等整体QC、样本和分析物异常值识别、内标归一化、外标校准、分析干扰校正、运行顺序漂移和批次效应校正,以及基于缺失率、信号空白比、变异系数、线性和D-ratio等标准进行分析物过滤。最终可输出定量数据集、QC报告和完整处理记录,从而形成可重复的端到端分析流程。

图1|MRMhub端到端工作流程,包括INTEGRATOR的保留时间校正、跨样本峰识别和共识积分,以及QUANT的定量、质量控制、漂移校正、特征筛选和报告输出。



结果

INTEGRATOR通过跨样本共识提高大规模峰积分稳定性

大规模MRM数据中最容易出现的问题之一,是同一化合物在数周分析过程中逐渐发生保留时间漂移。如果每个样本独立寻找峰,算法可能将相邻干扰峰误认为目标峰,也可能由于漂移导致固定积分窗口逐渐偏离真实峰。


INTEGRATOR没有将每个色谱图孤立处理,而是利用整个分析序列建立分析物的动态保留模式。首先根据参考保留时间对不同样本进行对齐,然后跨样本寻找候选色谱峰,从整个队列中识别一致的峰位置和边界趋势,最后再根据每个样本的局部峰形进行细化。这样既能保留个体样本差异,又利用了大规模数据本身提供的共识信息。   


这一设计对于非随机干扰尤其重要。某些共洗脱背景峰可能只在特定样本群或某一段分析序列中出现,如果仅按单一样本峰高进行选择,很容易发生误积分;跨样本观察则可以判断哪个色谱峰更符合目标分析物在整个实验中的连续行为。


同时,INTEGRATOR并非完全黑箱化。研究人员可以通过交互式图形界面查看不同样本中峰位置、积分边界以及保留时间漂移趋势,并进行必要调整。最终结果可以直接导出为CSV、PDF或可视化文件。这种“自动化为主、人工检查为辅”的设计,更适合要求较高的临床和人群研究。


QUANT将定量和质量控制整合到统一自动化流程

峰积分只是大型靶向代谢组学分析的第一步。之后还需要判断样本是否异常、某个分析物是否受干扰、内标是否稳定、校准曲线是否可靠,以及不同批次之间是否存在系统偏移。传统工作流中,这些步骤往往散落在多个Excel文件、脚本或商业软件中。


QUANT将这些过程组织为可重复执行的程序化管线。全局层面可以通过PCA等方法检查技术QC和真实样本的整体分布,快速识别批次偏移或极端样本;分析物层面则可以检查其与已知化学规律是否一致。例如在脂质组数据中,研究人员利用碳链长度、双键数量与保留时间之间的规律检测潜在峰注释或积分异常。


在定量阶段,QUANT支持内标归一化、外部校准曲线以及不同定量策略,并可以针对整个分析序列监测浓度漂移。如果长期参考样本或批次QC显示明显趋势,则可进一步进行运行顺序和批次校正。


最终特征过滤并不是只根据单一指标,而可以综合缺失值比例、最低信号、信号/空白比、QC变异系数、校准线性和D-ratio等条件。这样,每一个分析物为什么被保留或剔除,都可以在最终QC报告中追踪,而不只是得到一张无法解释的数据表。


数千样本和数百特征可在普通电脑上快速完成处理

MRMhub的核心定位之一是“可扩展”。研究人员主要利用两个此前发表的大型靶向脂质组数据进行测试。SPERFECT数据集包含937个样本和482个MRM特征,DYNAMO数据集则包含4,591个样本和828个特征。   


论文图1e对整个流程耗时进行了拆分。SPERFECT实验的LC–MS数据采集本身约持续2周,而DYNAMO约持续6周;相比之下,数据处理时间非常短。在一台配备M2 Pro和32 GB内存的MacBook Pro上,SPERFECT的mzML转换约9秒、峰积分约8秒、定量和QC约30秒、报告生成约3.5分钟,最大内存占用不足1 GB。


对于更大的DYNAMO数据,峰积分约42秒,定量和QC约60秒,最终报告约8分钟。即使样本数量接近4,600、特征超过800,除原始厂商文件向mzML转换需要约48分钟外,其余完整数据处理仍可在10分钟左右完成,内存需求低于10 GB。


这形成了一个很明显的时间尺度对比:实验数据采集需要数周,而重新运行一次分析流程只需要几分钟。因此,如果研究人员调整QC阈值、修改某个峰积分参数,或者希望比较不同批次校正策略,不再需要担心重新处理整个队列成本过高,可以快速迭代分析。


自动化流程可用于大型脂质组学结果的系统质量控制

在真实脂质组数据中,MRMhub不仅输出浓度矩阵,还能够自动生成面向整个研究的QC概览。


例如,全局PCA可以观察技术QC、批次QC以及真实样本是否位于预期区域,并快速发现可能的异常样本。针对单个分析物,系统可绘制其随分析顺序变化的原始浓度,同时叠加长期参考样本、批次QC和真实样本趋势,以判断是否存在随时间积累的仪器漂移。


对于脂质分析物,MRMhub还能利用类别内部的色谱规律辅助检查。例如磷脂酰胆碱中,总碳原子数和双键数量通常会系统性影响保留时间。若某一特征明显偏离同类脂质的规律,则可能提示错误峰选择、干扰或注释问题。


论文中的最终post-QC报告按照脂质类别汇总分析物是否因100%缺失、缺失率过高、信号过低、信号/空白比不足、QC变异系数过大、校准线性不佳或D-ratio异常而被剔除。通过这种方式,研究人员能够直接看到不同类别中最终有多少特征通过所有QC标准。


在临床级定量实验中达到或超过厂商软件

研究人员进一步在一个血清类固醇激素临床级检测体系中评估MRMhub。该实验具有外部校准物、预先指定浓度的内部QC以及外部质量评价样本,因此比探索性代谢组学具有更加明确的参考真值。


MRMhub的完整处理结果能够达到或优于仪器厂商软件,说明该框架不仅适合研究型脂质组学,也可以处理具有严格定量要求的靶向LC–MS任务。


这一结果具有实际意义,因为开源自动化工具如果只能在探索性数据中运行,而无法满足定量分析中的校准和QC需求,其应用范围会明显受限。MRMhub试图把开放、可复现的数据处理与传统商业软件所强调的可靠定量结合起来。



讨论

MRMhub所解决的问题并不是如何检测更多代谢物,而是如何让已经成熟的靶向LC–MS技术真正扩展到数千甚至更大规模样本。对于人群代谢组学来说,实验和数据处理之间常存在明显的不对称:自动进样器可以连续运行数周产生海量数据,但后续人工积分和QC仍然可能依赖大量人工操作。MRMhub通过INTEGRATOR和QUANT将这一部分尽量程序化,使峰积分、定量、校正和QC形成连续的计算流程。


其中一个关键思想是充分利用大型数据集本身。传统积分往往逐个样本独立处理,而INTEGRATOR通过分析整个实验序列中峰位置和峰形的动态变化来决定积分边界。样本数量越大,实际上越能提供关于目标峰真实行为的统计信息,这使“大规模”不只是一个计算负担,也成为提高自动积分稳定性的优势。


另一个价值是可重复性。所有处理步骤、参数和QC标准都可以记录并重新执行。当数据发生变化、分析策略需要调整,或者研究团队希望比较两种处理方案时,可以重新运行完整流程,而不必重复大量人工操作。研究人员还计划进一步支持mzQC和扩展mzTab-M等社区标准,并辅助生成Lipidomics Minimal Reporting Checklist,从而提高不同实验室之间数据和方法的可交换性。


不过,这篇工作本身是一篇较短的Correspondence,重点在于介绍软件框架及其规模化性能,而不是对所有峰识别算法或定量策略进行系统基准。因此,现有正文并没有证明MRMhub在所有仪器平台、所有MRM方法或所有复杂基质中都优于其他方案。自动峰积分仍可能受到极端共洗脱、异常峰形或错误元数据影响,因此保留可视化复核和人工调整仍然必要。


总体而言,MRMhub提供了一套从原始MRM信号到最终定量矩阵的开放、快速和可追踪流程。它的实际价值更多体现在把过去分散的“峰积分—定量—QC—报告”环节连接起来,并将数周产生的数据压缩为几分钟级的可重复计算任务。对于正在向数千样本甚至人群尺度扩展的靶向代谢组学和脂质组学研究,这种数据处理基础设施可能与质谱仪本身的通量提升同样重要。

整理 | DrugOne团队


参考资料


Burla, B., Teo, G.S., Benke, P.I. et al. MRMhub: a scalable data-processing framework for large-scale targeted metabolomics. Nat Metab (2026). 

https://doi.org/10.1038/s42255-026-01629-2

内容为【DrugOne】公众号原创|转载请注明来源

内容中包含的图片若涉及版权问题,请及时与我们联系删除