DRUGONE
蛋白质之间的相互作用构成了几乎所有生命活动的基础,因此准确理解蛋白质复合体的协同进化规律,对于解析生命过程、预测突变效应以及设计新型蛋白具有重要意义。近年来,蛋白质语言模型已经能够高效学习单个蛋白质序列中的进化信息,并广泛应用于结构预测、功能注释和蛋白质设计。然而,这些模型大多局限于单体蛋白,对于多个蛋白组成的复合体缺乏有效建模能力,因此难以准确描述蛋白质-蛋白质相互作用。
研究人员提出了一种新的蛋白质语言模型——MSA Pairformer。该模型以多序列比对(MSA)为基础,借鉴AlphaFold系列模型中序列表示与残基对表示双向迭代优化思想,引入查询偏置注意力机制,使模型能够根据目标序列自动筛选最具进化相关性的同源序列,从而更加准确地学习蛋白质间协同进化规律。尽管模型仅利用单体蛋白MSA进行训练,却能够自然推广至蛋白质复合体建模。
实验结果显示,MSA Pairformer在蛋白质界面接触预测、界面突变效应预测以及亚家族特异性结合模式识别等任务中均明显优于现有蛋白质语言模型,同时模型规模仅约1.11亿参数,不足当前主流超大模型的1%,却取得了更高预测精度。这项工作证明,通过更符合生物学规律的模型架构设计,可以突破单纯依赖模型规模扩张的发展路线,为蛋白质语言模型的发展提供新的方向。

蛋白质通常并非单独发挥作用,而是通过形成各种蛋白质复合体完成细胞信号传导、代谢调控、免疫反应以及遗传调控等生命过程。因此,理解蛋白质之间如何相互识别、哪些残基参与结合,以及突变如何改变结合能力,是现代结构生物学和蛋白质工程的重要研究内容。
近年来,大规模蛋白质语言模型取得了巨大成功。这类模型通过学习海量蛋白质序列中的统计规律,能够自动获得结构、功能和进化等信息,在蛋白质结构预测和功能预测领域取得突破。然而,大多数模型都是针对单条蛋白质序列训练,其学习到的信息主要来源于单个蛋白内部的协同进化,因此难以刻画不同蛋白之间更加复杂的协同进化关系。
虽然近年来出现了一些基因组语言模型,希望利用相邻基因共同出现的信息学习蛋白质之间的关系,但研究发现,即使参数规模达到数十亿甚至上百亿,这类模型在真正的蛋白质相互作用建模中仍然表现有限。这说明,仅依赖扩大模型规模并不能解决蛋白质复合体建模问题。
另一方面,多序列比对能够直接保存蛋白质家族真实的进化信息。如果将两个发生相互作用的蛋白质序列进行配对构建联合MSA,其中隐藏着丰富的跨蛋白协同进化信号。AlphaFold2和AlphaFold3已经证明,多序列比对对于蛋白质结构预测具有重要价值。然而,现有MSA模型通常简单平均所有序列贡献,容易掩盖不同亚家族之间存在的特异性结合模式,因此仍存在较大改进空间。
基于这一认识,研究人员设计了MSA Pairformer,希望利用更加符合生物进化规律的信息提取方式,实现从单体蛋白语言模型向蛋白质复合体语言模型的自然扩展。
方法
研究人员在AlphaFold3的MSA模块基础上构建了MSA Pairformer。模型同时维护残基层表示和残基对表示,并通过Pair-weighted Averaging、Query-biased Outer Product以及Triangle Update三个模块不断交替更新,使序列信息与残基间关系共同优化。与传统MSA模型最大的不同在于,新模型加入查询偏置注意力机制,根据目标蛋白自动学习每条同源序列的重要程度,而不是简单平均所有MSA信息。整个模型仅利用单体蛋白MSA进行掩码预测训练,随后分别评估其在蛋白质界面接触预测、界面突变预测、蛋白质配对、亚家族识别、单体接触预测以及突变效应预测等多个任务上的性能,并与MSA Transformer、ESM2、ESMC、gLM2等主流模型进行比较。
结果
MSA Pairformer总体架构实现蛋白质相互作用建模
研究人员首先介绍了MSA Pairformer整体架构。模型保留了AlphaFold系列双向更新序列表示和残基对表示的核心思想,同时加入查询偏置外积模块,使模型能够自动判断哪些同源序列对当前目标最有价值,而不是简单平均所有MSA信息。
整个模型仅采用约1.11亿参数,在一块H100 GPU上训练约十天即可完成训练,相比当前需要数百块GPU训练的超大蛋白语言模型,大幅降低了计算资源需求。
尽管训练过程中仅使用单体蛋白MSA,研究人员假设模型学习的是如何从MSA中提取进化信息,因此理论上可以直接推广至蛋白质复合体,而无需重新训练。

图1: MSA Pairformer总体架构及蛋白质相互作用建模流程。
MSA Pairformer显著提高蛋白质界面接触预测能力
随后,研究人员利用30种已知晶体结构的细菌蛋白质复合体测试模型预测蛋白质界面接触能力。
结果显示,MSA Pairformer在蛋白质界面接触预测中取得明显领先。相比MSA Transformer,预测精度提高接近三倍;相比近年来的大型蛋白语言模型ESMC、E1以及基因组语言模型gLM2,也具有明显优势。
进一步分析发现,传统MSA Transformer在预测蛋白质界面时往往倾向于压制跨链接触信号,而MSA Pairformer能够持续保持较高预测置信度。在预测概率超过0.75的界面残基中,绝大多数与真实晶体结构高度一致。
研究人员还进一步优化了蛋白质配对MSA构建策略,通过利用细菌基因组中相邻基因往往共同作用这一规律,提高正确蛋白配对比例,从而进一步提升模型对于蛋白质复合体协同进化信息的提取能力。
这些结果证明,MSA Pairformer已经能够有效学习蛋白质之间的协同进化关系,而不仅仅局限于单个蛋白内部。

图2: MSA Pairformer实现高精度蛋白质界面接触预测,并显著优于现有蛋白质语言模型。
MSA Pairformer准确预测蛋白质界面突变效应及相互作用配对
为了进一步验证模型真正理解蛋白质相互作用,而不仅仅预测接触,研究人员分析了一套包含九千多个毒素—抗毒素界面突变的数据集。
实验发现,MSA Pairformer能够最准确地区分仍保持结合能力和失去结合能力的突变体,其预测准确率明显优于MSA Transformer、PoET、ESMC以及传统Potts模型。
进一步分析模型学习到的残基之间依赖关系发现,MSA Pairformer能够更准确恢复蛋白质界面真实存在的协同进化网络,因此对于界面突变影响具有更强预测能力。
研究人员随后进一步研究另一个长期存在的问题——如何正确配对两个蛋白家族中的互作蛋白。由于同一物种中往往存在多个相似蛋白,真正发生结合的配对关系并不容易确定。
针对这一问题,研究人员设计了两种新的高效优化算法,能够利用MSA Pairformer学习到的进化信息自动寻找最佳蛋白配对关系。
相比此前DiffPALM方法,新算法不仅配对准确率进一步提高,而且显著降低计算资源需求。GPU显存占用下降到不足原来的几十分之一,运行时间也由二十分钟缩短到约一分钟,使大规模蛋白质配对分析成为可能。

图3: MSA Pairformer准确预测蛋白质界面突变效应,并实现高效蛋白质相互作用配对。
查询偏置注意力揭示蛋白质亚家族特异性结合模式
研究人员进一步探索了查询偏置注意力机制的作用。他们选择经典响应调控蛋白家族作为测试对象。虽然这些蛋白整体结构高度相似,但不同亚家族形成二聚体时采用完全不同的结合界面。
传统MSA模型由于平均所有序列贡献,因此容易混合不同亚家族信号,无法恢复真实结合模式。而MSA Pairformer则根据查询序列自动提高同亚家族成员权重,降低其他亚家族影响,从而准确恢复不同亚家族特有的界面接触模式。
进一步分析发现,模型赋予不同序列的权重与是否属于同一亚家族高度一致,而且这种判断并不仅依赖序列相似性,即使序列一致性很低,只要属于同一进化分支,模型仍能够识别其重要性。
这一机制说明,MSA Pairformer不仅学习蛋白质序列本身,还能够自动学习蛋白家族内部更加精细的进化关系,为研究不同功能亚家族提供了新的工具。

图4: 查询偏置注意力实现蛋白质亚家族特异性结合模式识别。
在单体蛋白任务中同样达到国际领先水平
最后,研究人员评估模型在传统单体蛋白任务上的表现。在CASP15蛋白质接触预测基准测试中,MSA Pairformer获得目前最高预测精度,不仅超过MSA Transformer,也超过参数规模达到150亿以上的ESM2系列模型。
更重要的是,当引入最新测序数据库中的新同源序列后,MSA Pairformer无需重新训练即可自动利用新增进化信息,预测准确率进一步提高。而传统单序列语言模型由于知识已经固化在参数中,无法直接利用新增数据。
在ProteinGym突变效应预测数据集上,MSA Pairformer同样取得最佳综合性能,在保持最高接触预测精度的同时,没有出现大型模型随着参数增加反而导致突变预测下降的问题。
这一结果证明,MSA Pairformer不仅能够扩展到蛋白质相互作用建模,而且在传统蛋白质语言模型任务中同样具有国际领先性能。

图5: MSA Pairformer在蛋白质接触预测和突变效应预测中同时达到国际领先水平。
讨论
研究人员认为,MSA Pairformer最大的突破在于首次证明,仅利用单体蛋白训练得到的MSA语言模型,也能够自然推广到蛋白质复合体建模。这意味着模型真正学习到的是蛋白质进化规律,而不是简单记忆训练数据。
相比近年来依赖不断扩大参数规模的发展路线,MSA Pairformer展示了一条更加符合生物学规律的发展方向。模型参数不足目前主流超大模型的百分之一,却能够在蛋白质界面接触预测、界面突变预测以及蛋白质相互作用建模等多个关键任务上全面超越大型模型,说明合理的模型架构设计比单纯增加模型规模更加重要。
研究人员特别强调,查询偏置注意力机制不仅能够自动识别不同亚家族,还能够揭示不同蛋白亚家族特有的结合方式。这一能力未来有望用于研究蛋白质不同构象、不同寡聚状态以及不同功能分支之间的进化规律,为蛋白质分类、结构预测和功能解析提供新的理论基础。
此外,由于MSA Pairformer能够在推理阶段直接利用最新测序数据库中的新增序列,因此随着公共数据库持续扩充,其预测性能仍将不断提高,而无需重新训练模型。这种持续适应能力对于快速发展的蛋白质数据库具有重要意义。
研究人员最后指出,MSA Pairformer仍然依赖高质量多序列比对,对于缺乏同源序列的新生蛋白、天然无序蛋白以及复杂重排蛋白仍存在一定局限;蛋白质配对算法目前主要验证了细菌蛋白,在真核蛋白和跨物种相互作用中的应用仍需进一步研究。
总体而言,MSA Pairformer突破了传统蛋白质语言模型只能描述单体蛋白的限制,将蛋白质语言模型正式扩展至蛋白质-蛋白质相互作用建模领域,同时证明了以生物学机制为核心设计模型架构,可以在显著降低计算成本的同时获得更高预测性能,为下一代蛋白质人工智能模型的发展提供了新的研究范式。
整理 | DrugOne团队
参考资料
Akiyama et al., Expanding the scope of protein language modeling to protein-protein interactions with MSA
Pairformer, Cell (2026)
https://doi.org/10.1016/j.cell.2026.06.029

内容为【DrugOne】公众号原创|转载请注明来源
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢