DRUGONE

精准医疗越来越依赖蛋白质组、代谢组、医学影像、实验室检查和电子健康记录等多模态数据,但真实临床环境中的数据并不像实验室研究那样完整。患者通常在不同时间接受不同检查,同一次就诊可能只有部分模态,而昂贵的蛋白质组和代谢组检测更难以反复获得。因此,临床数据本质上是一种具有大量缺失的“纵向马赛克”:不同模态既反映同一时刻的生理状态,又随着患者疾病进程共同发生变化。传统多模态模型大多针对单次快照设计,难以同时利用跨模态联系和跨时间变化。


针对这一问题,研究人员提出患者统一纵向信号引擎(Patient Unified Longitudinal Signal Engine,PULSE),将患者视为持续演化的动态生理系统。PULSE通过保存患者既往就诊形成的个体化“Past-State”,结合当前就诊能够获得的部分模态,在统一潜在空间中进行跨时间、跨模态对齐,进而重建当前缺失的临床数据。


研究人员在UK Biobank以及美国和中国多个临床队列中验证了该框架。PULSE能够根据常规血液检查重建251项代谢组指标,并进一步结合病史从61项常规实验室指标生成2,923维血浆蛋白质组。由生成蛋白质组训练的模型对多种常见疾病的预测性能接近真实蛋白质组。研究还将PULSE扩展至电子健康记录、ICU临床文本和视网膜眼底影像,证明跨模态纵向对齐不仅能够补全缺失数据,还能增强单一模态自身的生物医学表征能力。总体而言,PULSE提供了一种从廉价、稀疏和不完整的常规临床数据中恢复高维生理信息的策略,为降低深度表型分析成本和发展纵向个体化医疗提供了新的技术路径。

现代精准医疗的重要目标之一,是尽可能完整地描述患者的生理状态。蛋白质组和代谢组等深度分子表型能够提供远超常规检查的信息,并且当这些数据被纵向采集时,可以揭示同一个体随时间发生的变化,而这些变化往往无法通过单次横断面检测观察到。然而,大规模重复开展多组学检测成本高、操作复杂,因此现实医疗体系仍主要依赖少量常规实验室检查。结果是,临床数据库通常只记录了患者完整生理状态的一小部分。


单细胞多模态学习提供了一个重要启发:转录组、染色质可及性和表面蛋白虽然属于不同模态,却可以被理解为同一个潜在生物学状态的不同观察窗口,因此可以利用一种模态的信息推断另一种模态。但是临床数据与单细胞数据存在根本区别。单个细胞通常只能被测量一次,而患者会反复就诊。因此,患者数据不仅存在同一次就诊中的跨模态相关性,还包含跨就诊时间点的生理协同变化。


目前的纵向临床模型虽然已经广泛采用循环神经网络和Transformer,但多数模型主要分析单一模态;即使加入多模态信息,也往往采用简单拼接或分别编码后再进行后期融合。与此同时,许多模型依赖疾病标签或病例—对照状态学习患者表征。然而人体生理状态并非简单的“健康/疾病”二元状态,而是沿着连续轨迹变化。离散诊断标签既不能完整表示这种连续变化,也可能引入标签偏差。


研究人员因此提出一个不同的视角:患者应被视为一个动态系统,不同临床模态是这个不断演化的潜在生理状态的互补观察。当一个模态随时间发生变化时,其他模态可能发生的变化范围也会受到限制;患者自己的既往状态则可以作为当前状态的重要参照。基于这一思想,研究人员开发了PULSE,希望通过联合学习“跨模态关系”和“跨时间关系”,从不完整的纵向临床记录中恢复更完整的患者生理状态。



方法

PULSE是一种面向纵向多模态临床数据的变分生成框架。对于患者的每一次就诊,模型分别编码当前可获得的实验室检查、代谢组、蛋白质组、影像或临床文本等模态,同时将前一次就诊形成的个体化潜在状态作为Past-State输入。不同模态及历史状态通过软分布对齐映射到共享潜在空间,再融合形成当前的Visit-State,并由解码器重建当前就诊的完整多模态信息。当前Visit-State随后经过RNN式或Transformer式时间传播模块,成为下一次就诊的历史状态。训练过程中,研究人员主动随机遮蔽原本存在的模态,并要求模型利用剩余模态和历史信息将其恢复,从而迫使网络真正学习跨时间和跨模态推断,而不是简单复制输入。研究覆盖UK Biobank中的常规实验室检查、代谢组、蛋白质组和病史数据,以及视网膜影像、儿童近视纵向队列、系统性疾病队列和美国MIMIC-III及中国温州ICU队列,并与MIDAS、scVAEIT、StabMap、Transformer、LLM及后期融合等不同类型方法进行比较。



结果

PULSE构建患者纵向多模态生理状态

PULSE最核心的设计是Past-State。研究人员认为,相同的实验室检测数值对于不同患者并不一定意味着完全相同的生理状态,因为患者具有不同的基础水平和既往变化轨迹。因此,与其只根据当前一次检查进行推断,不如将患者此前的生理状态作为当前数据的个体化背景。


在第N次就诊中,PULSE首先将当前存在的不同模态编码为各自的潜在表示,同时利用Past-State分支表示患者此前的生理状态。模型随后采用软分布对齐,使这些表示进入共同的潜在生理空间,但并不强迫不同时间点或不同模态具有完全相同的编码。经过融合形成的Visit-State既包含当前观测信息,也包含与患者个人历史有关的上下文,最终用于生成当前缺失的模态。

图1|PULSE纵向多模态临床数据建模框架。


PULSE显著提高纵向代谢组重建准确性

研究人员首先利用约10,000名具有基线和随访数据的UK Biobank参与者进行测试,其中包括61项常规实验室指标和251项代谢组生物标志物。模型的任务是在随访时仅获得常规实验室检查的情况下,重建患者同期的完整代谢组;PULSE还能够利用该患者基线时的完整多模态状态作为历史信息。


与MIDAS、scVAEIT和StabMap相比,PULSE在251种代谢物整体上的Pearson相关性、平均绝对误差和均方误差均表现更优。进一步分析发现,具有较高个体内纵向稳定性的代谢物往往也具有更高的预测准确率,说明模型并非简单学习群体平均值,而是在一定程度上利用了患者特异性的稳态特征。


以大LDL颗粒中游离胆固醇与总脂质比例为例,研究人员比较了真实纵向变化与模型预测变化。完整PULSE模型的相关系数达到0.850,明显高于只使用当前实验室检查或只使用历史信息的模型,也优于多个静态多模态方法。消融实验进一步显示,去除Past-State会明显降低重建性能;去除潜在空间对齐损失同样造成显著下降,说明历史状态和跨模态分布对齐是PULSE性能提升的核心来源。

图2|PULSE在纵向代谢组重建任务中的性能比较。


联合潜在空间揭示不同的生物衰老轨迹

PULSE学习到的共享潜在空间不仅可以用于数据补全,还表现出具有临床意义的生物学结构。研究人员构造包含完整双模态、仅实验室检查以及仅代谢组数据的人工不配对数据集。尽管输入模态不同,PULSE仍能够将三类样本映射到连续统一的潜在空间。


按照年龄对潜在空间进行着色后,可以观察到明显的整体年龄梯度,但同一年龄的人群仍沿另一方向产生显著分化。这意味着年龄相同的人并不一定处于相同的生理衰老状态。进一步进行轨迹推断后,研究人员观察到三条稳定的长期变化路径,并按照个体在同年龄人群中的潜在空间位置将其划分为三个轨迹组。


疾病随访分析显示,其中一条轨迹上的个体在慢性阻塞性肺疾病、糖尿病、心力衰竭和卒中等多种年龄相关疾病中具有持续更高的累积发病风险,因此研究人员将其解释为一种“加速衰老”轨迹。这表明PULSE学习到的连续生理状态可能包含传统年龄或二元疾病标签难以表达的健康差异。

图3|PULSE联合潜在空间揭示生物衰老轨迹及其与疾病风险的关系。


从常规临床数据生成具有疾病预测价值的蛋白质组

考虑到现实医疗中患者通常没有既往多组学数据,研究人员进一步尝试使用更容易获得的病史作为Past-State的替代信息。在约50,000名UK Biobank蛋白质组计划参与者中,PULSE利用61项常规实验室检查和既往诊断、用药及共病等医学史,生成包含2,923种蛋白的血浆蛋白质组。


对于绝大多数蛋白,完整PULSE模型的重建相关性均高于MIDAS、scVAEIT、StabMap以及去除部分输入的PULSE模型;对于15种具有多效性、与疾病密切相关的重要蛋白,也保持了较高的重建准确率。研究人员还与基于疾病事件轨迹的模型、Llama 3.1以及标准Transformer进行了比较,整体表现为PULSE优于Transformer、Llama 3.1和疾病事件轨迹模型,说明明确建模当前实验室数据与历史背景之间的跨模态生理联系具有重要价值。


更重要的是,生成蛋白质组并非只有数值上的相似性。研究人员分别利用真实和生成蛋白质组预测心律失常、COPD、痴呆、心力衰竭、高血压和缺血性心脏病,生成蛋白质组模型的AUROC约为0.72–0.83,与真实蛋白质组极为接近。例如COPD分别为0.806和0.808,心力衰竭均为0.834。 进一步的特征解释分析显示,两类模型所依赖的重要蛋白高度一致,说明PULSE在生成过程中保留了与疾病相关的生物学结构,而不仅仅是在统计意义上拟合真实蛋白水平。

图4|利用常规实验室检查和医学史生成血浆蛋白质组及其疾病预测能力。


PULSE跨医疗系统和不同模态实现泛化

为了验证模型是否适用于更复杂的真实临床环境,研究人员进一步分析美国MIMIC-III和中国温州两个独立ICU队列,任务是利用进入ICU后最初48小时的结构化实验室检查和非结构化临床文本预测出院后30天再入院风险。PULSE将48小时划分为连续4小时窗口,在每个时间步对齐实验室数据和临床文本,同时持续传播患者历史状态。


在MIMIC-III中,PULSE获得0.713的AUROC和0.193的AUPRC,高于简单多模态融合、仅使用临床文本的LLM以及仅使用实验室检查的Transformer。在温州ICU队列中,PULSE的AUROC和AUPRC分别达到0.735和0.388,同样优于其他方法。这种在美国和中国两个不同医疗体系中的一致提升,说明跨时间、跨模态对齐原则能够扩展到高度异质的急重症临床数据。


研究人员随后进一步将PULSE扩展到差异更大的模态——视网膜眼底影像和血液实验室检查。儿童近视队列包括24,605名儿童和50,043次就诊。PULSE首先通过纵向跨模态预训练将眼底影像与实验室指标对齐,随后仅输入实验室数据预测未来1–5年的眼轴长度和等效球镜变化。与直接在实验室数据上训练的模型相比,经过跨模态预训练的PULSE在所有预测时间跨度均表现更好,说明模型能够将眼部相关信息“蒸馏”进血液检查表征。


反过来,研究人员又在127,731名成人、657,103次就诊组成的纵向队列中,让眼底图像通过与实验室检查对齐而学习全身性生理信息,再预测未来5年缺血性卒中、心肌梗死、心力衰竭和痴呆风险。无论使用单次眼底影像还是多个时间点影像,经过PULSE跨模态对齐预训练的模型均优于传统图像自监督预训练模型;在UK Biobank外部验证中,这一优势仍然存在。


这一结果揭示了PULSE更深层的作用:跨模态学习并不只是“根据A生成B”,还可以利用B中蕴含的生物学信息改善A自身的表示。因此,多模态数据即使在实际预测阶段无法同时获得,也仍然可以在预训练阶段作为彼此的生物学监督信号。

图5|跨模态纵向对齐增强实验室检查和视网膜影像的单模态疾病预测能力。



讨论

PULSE与传统纵向临床模型的核心差别并不只是采用了新的神经网络结构,而是改变了临床多模态数据的建模对象。传统方法通常把患者记录理解为一串事件,把不同模态进行拼接或独立编码后融合;PULSE则认为实验室检查、蛋白质组、代谢组、医学影像和临床文本都是同一个潜在生理状态在不同层面的投影,而且这种潜在状态会随时间连续演化。因此,模型真正需要学习的是“患者生理状态如何变化,以及不同模态如何共同反映这种变化”。


这一思想使PULSE具有两个值得关注的能力。首先,它能够利用过去的信息约束当前缺失模态,在真实临床常见的不完整纵向数据中提高重建可靠性。其次,多模态对齐本身可以成为一种生物医学表征学习机制。例如,将实验室检查与眼底影像对齐之后,即使最终只输入其中一种模态,也能够获得更强的预测能力。这意味着昂贵模态不一定需要在所有患者和所有时间点持续测量,它们可以作为训练阶段的“生物学教师”,帮助模型从廉价常规数据中提取更丰富的生理信号。


生成蛋白质组的结果尤其体现了潜在临床价值。PULSE尝试将廉价、异质的常规临床信息转换成结构化的高维分子表型,而生成数据在疾病预测中的表现接近真实蛋白质组。在缺少真实蛋白质组的大规模UK Biobank人群中,加入PULSE生成蛋白质组后也能够进一步提高预测能力。因此,研究人员认为生成过程可能不仅是缺失值填补,还具有“表征优化器”的作用,即将分散于实验室指标和病史中的信息重新组织到更接近生物分子机制的特征空间。


这种模式还可能降低精准医疗对昂贵深度表型技术的依赖。如果未来经过充分临床验证,可以设想只在部分患者或部分时间点获得高成本蛋白质组、代谢组或影像数据,再利用常规检测和历史记录推断其他时间点的高维状态,从而使原本主要存在于大型生物样本库中的深度表型能力更接近常规医疗环境。


不过,PULSE目前仍属于概念验证框架,而不是可以直接普遍部署的临床基础模型。研究人员特别指出,当前模型主要学习群体层面的共享时间结构和跨模态关系,不同任务中训练得到的模型不能假定可以直接推广至所有人群、种族结构或医疗系统。每一种具体应用仍需要独立验证,并最终接受前瞻性临床评估。随着未来单个患者积累更多随访时间点、更完整的多模态信息和更长观察周期,PULSE还可以进一步发展为真正的患者特异性模型,通过个体化微调或分层建模区分一个人的稳定生理基线、变化速度和疾病演进方向。


总体来看,这项研究的意义不仅在于提出一种新的临床数据补全算法,而在于提供了一种面向纵向精准医疗的数据建模范式:不再把每次就诊视为彼此独立的临床快照,也不再把不同模态视为简单拼接的特征,而是把患者视为持续变化的生理系统,将不同时间、不同模态的数据共同投射到一条个体化生理轨迹中。 在这一框架下,稀疏常规检查、历史病历、医学影像与高维组学数据能够相互提供监督和约束,为从现实世界“不完整但丰富”的医疗数据中构建连续患者数字表型提供了新的方向。

整理 | DrugOne团队


参考资料


Wu, W., Li, G., Wang, K. et al. Longitudinal alignments and syntheses of multimodal clinical data for personalized medicine with the PULSE framework. Nat Comput Sci (2026). 

https://doi.org/10.1038/s43588-026-01026-5

内容为【DrugOne】公众号原创转载请注明来源

内容中包含的图片若涉及版权问题,请及时与我们联系删除