DRUGONE

近年来,单细胞测序技术快速发展,使研究人员能够在单细胞分辨率下同时测量转录组、染色质开放性、蛋白表达等多种分子信息,为构建跨组织、跨疾病、跨模态的单细胞图谱提供了基础。然而,现有单细胞图谱通常采用离线整合方式,每当新的数据产生时,都需要重新整合全部历史数据,不仅计算成本随数据规模快速增长,而且难以满足持续更新生物图谱的需求。此外,新数据往往来自不同测序平台、不同组织甚至不同组学组合,传统方法容易出现灾难性遗忘,无法同时保持已有知识和学习新的生物学信息。


针对这一问题,研究人员提出了MIRACLE(Multimodal Integration with Continual Learning),一种基于持续学习的单细胞多模态持续整合框架。该方法以多模态变分自编码器MIDAS为基础,引入动态网络结构扩展和数据回放机制,使模型能够不断整合新增数据,同时保留已有知识。为了进一步降低内存消耗,研究人员设计了分布保持蓄水池采样策略,通过球树采样算法在有限存储空间内最大程度保留数据分布,实现高效的数据回放。


大量实验表明,MIRACLE能够在保持与传统离线方法相当整合精度的同时,大幅降低计算时间和存储开销。在跨批次、跨模态、跨组织及跨疾病等多个场景下,MIRACLE均优于现有在线整合方法,并能够持续扩展已有单细胞图谱,实现高质量标签迁移及新细胞类型识别。进一步应用于COVID-19、甲型流感和结核病等呼吸道感染数据后,MIRACLE不仅统一构建了跨疾病免疫图谱,还发现了多种新的免疫细胞亚群及共同免疫调控机制,展示了持续整合框架在生物医学研究中的广泛应用潜力。

单细胞测序技术的发展极大推动了生命科学研究,使研究人员能够在单细胞水平解析不同组织中复杂细胞群体的组成及其功能状态。随着单细胞RNA测序、ATAC测序、CITE-seq以及空间多组学等技术不断成熟,越来越多来自不同实验室、不同组织及不同疾病的数据不断积累,促进了大规模单细胞图谱的建设。这些图谱不仅能够揭示细胞异质性,还成为研究发育、生理及疾病机制的重要参考资源。


然而,单细胞数据具有持续产生的特点。新的实验不断加入新的细胞类型、新的组织来源以及新的组学模式,使已有图谱需要不断更新。如果每增加一批数据都重新整合全部历史数据,不仅计算资源需求急剧增加,而且随着图谱规模不断扩大,更新速度越来越慢,严重限制了单细胞图谱的实时扩展能力。


近年来,研究人员提出了一些在线整合方法,希望仅利用新增数据完成图谱更新。其中,一类方法依赖预训练模型,将新数据直接映射到已有图谱,但由于模型固定,面对新的组织来源、新的技术平台或新的细胞类型时容易失去泛化能力;另一类方法采用微调策略,使模型不断学习新增数据,但由于持续训练容易覆盖已有知识,因此产生灾难性遗忘,使模型逐渐失去对历史数据的准确表示。


与此同时,现有在线整合方法大多仅适用于单一组学,而现实中的单细胞数据往往属于多模态镶嵌数据,即不同数据集测量的组学组合并不相同。例如,有的数据同时测量RNA和ATAC,有的数据测量RNA和蛋白,还有的数据包含全部三种组学。这种复杂的数据结构进一步增加了持续整合难度。


研究人员因此提出持续学习框架MIRACLE,希望借助持续学习中的知识保持机制,使模型能够不断学习新增数据,同时避免遗忘已有知识,并进一步支持不同组学组合之间的持续整合,从而建立真正能够持续扩展的大规模单细胞多模态图谱。



方法

MIRACLE建立在多模态变分自编码器MIDAS基础之上,将持续学习机制引入单细胞多模态数据整合。模型能够依次接收不同时间产生的新数据,每当新批次加入时,仅利用新增数据及少量历史代表样本完成模型更新,而无需重新训练全部数据。针对新增组学或新增特征,MIRACLE自动扩展网络结构,并复制已有参数完成初始化,实现动态网络适配;针对灾难性遗忘问题,则利用数据回放策略保留历史知识。为了控制内存占用,研究人员进一步提出分布保持蓄水池采样算法,通过球树划分低维嵌入空间,在保持整体数据分布的同时仅保存有限数量代表细胞,从而实现高效持续学习。更新后的模型不仅能够继续扩展已有图谱,还能够用于新数据标签迁移及不同研究团队之间共享,实现持续更新的单细胞知识库。



结果

MIRACLE建立持续学习驱动的单细胞多模态整合框架

MIRACLE最大的特点是将持续学习思想首次系统引入单细胞多模态数据整合。模型按照数据产生时间依次接收新的单细胞数据,而不是像传统方法一样一次性读取全部数据。每完成一次训练后,模型都会保留一部分具有代表性的历史样本作为回放记忆,当新的数据到来时,模型同时学习新增数据和历史代表样本,从而避免遗忘已有知识。


针对多模态数据不断变化的问题,研究人员设计了动态网络扩展机制。当新增数据包含此前从未出现的新组学或新特征时,模型自动增加新的编码器和解码器,并继承已有参数进行初始化,使网络能够不断适应新的数据结构,而无需重新训练整个模型。


此外,研究人员还提出球树采样算法,用于在有限内存中保留最具代表性的历史样本。与传统随机采样相比,该方法能够更好保持数据原有分布,使有限数量细胞仍能够代表整个图谱的生物学特征,为持续学习提供更加稳定的数据回放机制。


依托上述设计,MIRACLE不仅能够不断扩展已有图谱,还能够实现模型共享。研究人员建立好的参考图谱可以直接分享给其他实验室,其他研究人员仅需利用自己的数据继续更新模型,再将更新后的模型继续共享,从而形成不断扩展的协同单细胞知识库。

图1: MIRACLE持续学习框架、球树采样策略及持续更新单细胞图谱总体流程。


有限内存条件下实现高质量持续整合

为了验证持续学习框架是否能够真正保持历史知识,研究人员首先利用超过52万个人心肌病单细胞RNA测序数据进行了测试。由于持续学习需要保存部分历史数据,研究人员首先比较了不同采样方法对于原始数据分布保持能力。


结果发现,传统随机采样虽然计算速度较快,但不同采样结果之间波动较大,而球树采样能够更加稳定地保持原始细胞分布,其数据分布与完整数据最为接近。进一步利用UMAP可视化可以观察到,即使仅保留极少部分历史细胞,球树采样后的细胞仍然覆盖原始数据的大部分结构,而其他采样方法则容易丢失稀有细胞群体。


随后,研究人员进一步分析不同内存容量对持续整合性能的影响。随着保存历史细胞数量增加,模型性能不断提升,但当记忆容量达到约两万个细胞后,性能基本趋于稳定,而这一数量仅占全部数据约二十六分之一,说明MIRACLE能够利用极少历史数据维持较高整合质量。


进一步与传统离线整合、普通迁移学习以及预训练模型进行比较发现,采用球树采样的MIRACLE几乎达到离线整合的最佳性能,而普通迁移学习由于缺乏历史数据回放,随着不断加入新数据,逐渐出现明显灾难性遗忘,不同批次之间再次发生分离。


与此同时,离线整合随着批次数不断增加,其累计运行时间快速增长,而MIRACLE由于每次仅处理新增数据,因此单次更新时间始终保持稳定,总计算时间远低于传统离线方法。在超过230万个细胞的人肺细胞图谱上,这种优势更加明显,充分证明持续学习框架具有良好的可扩展性。

图2: MIRACLE在有限内存条件下的持续整合性能、采样策略比较及与现有在线、离线方法的综合评估。


跨批次与跨细胞类型的持续整合保持稳定生物学结构

为了进一步验证MIRACLE在真实持续更新场景中的能力,研究人员利用由八个CITE-seq批次组成的人外周血单个核细胞数据集进行了系统评估。为了增加整合难度,每个批次人为去除了部分细胞类型,使不同批次具有不同的细胞组成,从而模拟现实中不断加入新实验数据的情况。


随着新的批次依次加入,MIRACLE不断更新已有图谱。UMAP可视化显示,新加入的数据能够迅速与已有图谱融合,而原有批次之间的关系始终保持稳定。不同时间点得到的整合结果均能够有效消除批次效应,同时保留B细胞、CD4⁺ T细胞、CD8⁺ T细胞、单核细胞、树突状细胞及自然杀伤细胞等不同细胞群体之间清晰的生物学边界。随着图谱不断扩展,即使某些细胞类型仅在后续批次中出现,模型仍能够正确恢复其与已有细胞群体之间的关系。


研究人员随后比较了持续学习策略与普通迁移学习之间的差异。普通迁移学习由于每次仅针对新增数据进行微调,因此随着训练不断进行,模型逐渐遗忘早期批次的信息,最终导致同一种细胞重新按照批次发生分离,出现典型的灾难性遗忘现象。而采用持续学习机制后,MIRACLE始终保持不同批次细胞之间的充分混合,与完全离线整合几乎一致。


进一步利用单细胞整合基准评价体系进行定量分析后发现,MIRACLE在批次校正、细胞类型保持以及整体综合评分等多个指标上均达到最高水平。即使与11种当前主流单细胞整合方法相比,无论在线模式还是离线模式,MIRACLE均获得最佳综合成绩。一些离线方法虽然能够在一次性整合时取得较好效果,但转换为在线更新后性能明显下降,说明传统方法难以适应持续更新场景,而MIRACLE能够稳定保持长期积累的生物学知识。


MIRACLE实现复杂多模态镶嵌数据的持续整合

现实中的单细胞数据并非都包含相同组学组合。例如,一部分实验同时测量RNA和ATAC,另一部分同时测量RNA和蛋白,而还有部分实验能够同时测量三种组学。这种不同数据集之间组学组合并不一致的数据通常被称为镶嵌数据,也是当前单细胞整合中最困难的问题之一。


为了验证MIRACLE处理此类问题的能力,研究人员进一步构建了包含DOGMA-seq和TEA-seq等多个数据集的DOTEA测试集,其中八个批次覆盖ATAC+RNA、RNA+蛋白、ATAC+蛋白以及三组学联合测量等四种不同组合,同时不同批次还具有不同细胞组成。


持续整合结果显示,随着新批次不断加入,MIRACLE能够自动完成不同模态之间的信息对齐,不同组学来源的数据最终聚集到相同细胞类型附近,而不会按照测序平台重新聚类。与此同时,模型推断得到的技术噪声在不同模态之间也逐渐趋于一致,说明MIRACLE不仅完成了批次校正,还有效统一了不同组学之间的表示空间。


研究人员随后与Multigrate、scVAEIT等目前代表性的多模态整合方法进行了比较。结果发现,在离线模式下,多数方法均能够取得较好的整合效果;但进入持续更新模式后,这些方法由于缺乏持续学习机制,很快出现批次重新分离、细胞类型混杂等问题。而MIRACLE不仅保持与离线整合几乎相同的结果,在整体综合评价指标上甚至略高于离线版本。


研究人员认为,这种现象来源于持续学习过程中形成的"课程学习"效应。模型按照数据不断增加的顺序逐步学习新的生物学信息,相比一次性训练全部数据,更容易逐渐建立稳定的数据表示,从而避免优化过程中陷入局部最优。这一发现说明,持续学习不仅能够提高计算效率,还可能进一步改善模型泛化能力。

图3: MIRACLE在多模态镶嵌数据持续整合中的性能比较及不同组学组合之间的统一表示。


持续构建跨组织单细胞图谱并实现精准标签迁移

持续整合的重要目标之一,是不断扩展已有单细胞图谱,而不是每次重新建立新的参考图谱。为此,研究人员进一步设计了跨组织持续构建实验。


首先,以包含34个PBMC批次的数据作为初始参考图谱,随后依次加入NEAT、ASAP及ASAP-CITE等不同模态的新PBMC数据,实现同一组织内部的持续扩展。进一步,又连续加入来自扁桃体、骨髓和脾脏三个不同组织的新数据,实现真正意义上的跨组织图谱构建。


整合结果显示,新加入组织能够自然融合进入已有PBMC图谱,同时保留不同组织固有的细胞状态。例如,扁桃体中新出现的生发中心B细胞和增殖B细胞形成独立簇;骨髓中新出现的祖细胞同样能够保持清晰边界,而不会错误混入PBMC已有细胞类型之中。


随后,研究人员进一步比较三种在线更新策略。直接利用预训练模型虽然能够完成已有细胞类型映射,但对于此前从未出现的新细胞类型几乎无法识别;普通迁移学习则同时出现批次效应和细胞混杂。而MIRACLE不仅能够保持已有图谱稳定,还能够自动发现新的细胞类型,并保持与离线构建图谱高度一致。


进一步利用邻域一致性分析发现,MIRACLE更新后的细胞邻域结构几乎完全保持离线整合结果,而另外两种方法均出现明显偏差。标签迁移结果同样表明,MIRACLE转移得到的细胞标签与真实标签高度一致,在跨组织场景下仍能够保持极高准确率。


为了进一步验证模型实际应用能力,研究人员又利用持续构建好的参考图谱对新的查询数据进行自动注释。结果显示,在同组织标签迁移中,MIRACLE始终获得最高Micro F1值;而在跨组织场景下,对于此前从未出现的新细胞类型,模型能够准确识别为未知类型,并进一步定位新的生发中心B细胞、增殖B细胞及祖细胞等新群体,而其他方法几乎无法完成这一任务。


这些结果说明,MIRACLE不仅能够持续扩展已有图谱,还能够真正实现跨组织知识共享,为未来构建不断演化的单细胞参考图谱提供了新的解决方案。

图4: MIRACLE持续构建跨组织单细胞图谱及不同持续更新策略比较。


图5: MIRACLE跨组织标签迁移、新细胞类型识别及参考图谱共享流程。


持续整合呼吸道感染单细胞图谱揭示共同免疫机制

为了展示MIRACLE在真实生物医学研究中的应用价值,研究人员进一步将其应用于COVID-19、甲型流感和结核病三种呼吸道感染数据。


首先,以健康PBMC参考图谱作为起点,随后依次加入COVID-19、甲型流感和结核病患者PBMC数据,实现跨疾病持续更新。随着不同疾病不断加入,原有参考图谱逐渐扩展成为统一的呼吸道感染免疫图谱,并最终将原有十三类细胞进一步细分为二十三类免疫细胞。


在COVID-19数据中,模型发现原始研究中的一部分CD8⁺ T细胞实际上更符合CD4⁺细胞毒性T细胞特征。进一步分析显示,这些细胞同时表达CD4及多种细胞毒分子,并具有更高细胞毒活性,在中度COVID-19患者中明显富集,提示其可能参与病毒感染过程中免疫反应调控。


在甲型流感数据中,研究人员进一步发现一个此前未被充分认识的HERC1阳性T细胞亚群。这类细胞表现出明显PD-1信号通路激活,同时表达PD-L1和PD-L2,而CD8⁺细胞毒T细胞则表达更高PD-1,提示二者之间可能共同参与T细胞耗竭过程。这种现象仅出现在流感患者中,而健康人及COVID-19患者中均未观察到。


在结核病数据中,MIRACLE重新识别出一部分此前被归类为不同T细胞亚群的细胞,证明其实际上属于MAIT细胞。进一步比较发现,MAIT细胞在COVID-19、流感及结核病患者外周血中均明显减少,同时其细胞毒相关基因表达下降,提示不同呼吸道感染可能共同导致MAIT细胞功能受损,但不同疾病影响程度存在差异。


研究人员认为,持续整合不同疾病数据,使模型能够直接比较不同感染之间共同和特异性的免疫调控机制,而无需重新整合全部历史数据。这充分体现了持续学习框架在疾病监测和持续更新医学知识库方面的重要优势。

图6: MIRACLE持续构建呼吸道感染免疫图谱及COVID-19、甲型流感和结核病共同免疫机制分析。



讨论

MIRACLE首次将持续学习系统引入单细胞多模态数据整合,使单细胞图谱从一次性构建转变为能够持续演化的动态知识体系。与传统离线整合相比,MIRACLE无需每次重新处理全部历史数据,仅利用新增数据及少量代表性历史样本即可完成图谱更新,大幅降低了计算资源需求,同时有效避免灾难性遗忘。


研究结果表明,动态网络扩展、数据回放以及球树采样共同构成了持续学习框架的核心。其中,动态网络保证模型能够不断适应新的组学和新特征;球树采样则在极低内存消耗下最大程度保持数据分布;持续学习机制进一步保证历史知识长期保留,使持续整合结果始终接近传统离线方法。


MIRACLE还展示了良好的跨组织、跨疾病和跨模态泛化能力。模型不仅能够持续扩展已有参考图谱,还能够准确完成标签迁移、新细胞类型识别以及跨疾病联合分析,为未来不断更新的大规模单细胞知识图谱提供了新的技术框架。


研究人员进一步指出,未来MIRACLE可以继续融合空间转录组、DNA甲基化组、代谢组等更多类型数据,并结合图神经网络、联邦学习以及更先进的持续学习算法,实现更加智能、安全且可共享的单细胞持续分析平台。随着越来越多实验室持续贡献新的单细胞数据,这类能够不断积累知识的持续学习框架,有望成为未来单细胞图谱建设、疾病机制研究以及精准医学的重要基础设施。

整理 | DrugOne团队


参考资料


Zhou, J., Wang, J., Hu, S. et al. Continual integration of single-cell multimodal data with MIRACLE. Nat Comput Sci (2026). 

https://doi.org/10.1038/s43588-026-01030-9

内容为【DrugOne】公众号原创转载请注明来源

内容中包含的图片若涉及版权问题,请及时与我们联系删除