DRUGONE
近年来,蛋白质生成模型不断推动人工智能蛋白设计的发展,使研究人员能够直接生成具有特定结构和功能的新型蛋白。然而,在真实蛋白工程过程中,研究目标往往不仅要求生成天然样式的蛋白,还需要进一步提高稳定性、活性、表达水平或结合能力等实验性质。现有方法主要依赖大规模生成后再筛选(post hoc filtering)或重新微调生成模型(fine-tuning),前者随着目标性质变得稀有而采样效率迅速下降,后者则需要重新训练模型,并容易削弱预训练模型原有知识,难以同时处理多个相互竞争的优化目标。
研究人员提出ProteinGuide,一种无需重新训练生成模型即可实现在线性质引导(on-the-fly conditioning)的统一框架。ProteinGuide将预训练蛋白生成模型与性质预测模型通过贝叶斯统计原则结合,在生成过程中实时调整每一步采样概率,使最终生成序列直接来自满足目标性质的条件分布,而无需重新构建新的条件生成模型。该方法不仅适用于ProteinMPNN、ESM3等掩码语言模型和任意顺序自回归模型,也适用于MultiFlow等扩散和Flow Matching模型。研究人员进一步利用ProteinGuide完成蛋白稳定性优化、荧光蛋白增强、酶活性优化、多目标Pareto设计以及腺嘌呤碱基编辑器(ABE)工程化实验,均取得优于传统筛选和微调策略的结果,并首次利用一次AI引导设计获得性能超过七轮定向进化产生的碱基编辑器,为人工智能驱动的蛋白工程建立了统一、高效且具有广泛适用性的设计框架。

近年来,大规模蛋白质语言模型、扩散模型以及Flow Matching模型不断推动蛋白设计进入生成式人工智能时代。从ProteinMPNN、ProGen到ESM3,这些模型已经能够依据天然蛋白数据库学习复杂的序列分布,并生成具有合理折叠能力的新蛋白。然而,在真实蛋白工程中,研究目标通常并非简单生成天然蛋白,而是希望获得具有更高稳定性、更强催化活性、更高表达水平或更优结合能力的变体。
目前最常见的方法主要包括两类。第一类是后验筛选,即首先利用预训练模型生成大量候选蛋白,再借助预测模型从中筛选满足要求的序列。这种策略简单易用,但随着目标性质越来越罕见,能够满足条件的序列比例迅速降低,往往需要生成数百万甚至更多候选蛋白,计算成本急剧增加。第二类是微调生成模型,即利用实验获得的高性能序列继续训练预训练模型,使模型更加偏向目标区域。这一策略虽然能够提高目标序列比例,但需要重新训练生成模型,而且容易遗忘预训练模型学习到的大规模蛋白知识,使生成结果局限于已有实验数据附近,不利于突破现有性能上限。
另一方面,实际蛋白设计通常需要同时优化多个目标。例如,提高酶催化效率可能降低稳定性,提高目标结合能力又可能增强脱靶效应。现有方法很难灵活处理多个目标之间的权衡,更难根据实验不断调整优化方向。因此,研究人员希望建立一种无需重新训练生成模型、能够直接结合实验预测模型,并支持任意目标、任意生成模型以及多目标联合优化的新框架。
ProteinGuide正是在这一背景下提出。其核心思想是在蛋白生成过程中实时融合预训练模型与性质预测模型,使每一步采样都同时考虑天然蛋白分布和目标性质,从而实现真正意义上的在线条件生成。
方法
研究人员首先保留已有预训练蛋白生成模型,包括ProteinMPNN、ESM3、ESM Cambrian以及MultiFlow等,不对其参数进行任何重新训练。同时,根据具体设计任务利用实验测定数据训练性质预测模型,例如蛋白稳定性、荧光强度、酶活性、EC编号、CATH结构类别以及碱基编辑活性等预测器。ProteinGuide随后利用贝叶斯统计框架,在生成过程中每一步根据预训练模型预测下一位氨基酸的概率,再结合性质预测模型计算不同候选氨基酸对目标性质的贡献,从而实时修正采样分布。研究人员进一步证明,扩散模型、Flow Matching模型、掩码语言模型和任意顺序自回归模型虽然训练方式不同,但本质上可以统一到同一条件采样框架,因此ProteinGuide能够支持多种主流蛋白生成模型。针对不同计算场景,研究人员还设计了快速近似算法TAG和精确采样算法DEG,在保证生成质量的同时提高推理效率,并支持多个预测模型联合引导,实现多目标蛋白设计。

图1: ProteinGuide整体框架及在线性质引导生成流程。
结果
ProteinGuide建立统一的蛋白性质引导生成框架
研究首先介绍了ProteinGuide的理论基础。传统蛋白生成模型仅学习天然蛋白分布,而ProteinGuide进一步引入独立训练的性质预测模型,在生成过程中不断重新计算下一步采样概率,使最终生成序列更加符合目标性质。
为了实现这一目标,研究人员首先证明四类目前最主流的蛋白生成模型——掩码扩散模型、Flow Matching模型、掩码语言模型以及任意顺序自回归模型——虽然采样方式不同,但训练目标具有统一形式,因此都能够采用相同的性质引导策略。这意味着ProteinGuide无需针对不同模型分别开发算法,而可以作为统一的推理层直接作用于各种预训练模型。
相比传统Fine-tuning,ProteinGuide最大的特点是不需要重新训练生成模型,仅需提供已有预测模型即可实时完成条件采样,因此不会破坏预训练模型已经学习的大规模蛋白知识。同时,由于整个采样过程始终遵循贝叶斯统计关系,因此生成结果能够自然平衡天然蛋白分布和目标性质,而不是简单偏向少量实验数据。
研究人员认为,这一统一框架使ProteinGuide成为目前适用范围最广的蛋白性质引导方法之一,为后续各种蛋白设计任务奠定了基础。

图2: ProteinGuide统一扩散模型、Flow Matching、掩码语言模型及ProteinMPNN等不同生成模型的性质引导机制。
ProteinGuide显著提高蛋白性质优化能力
随后,研究人员首先在多个代表性蛋白工程任务中验证ProteinGuide的性能。
第一项实验利用ProteinMPNN优化蛋白稳定性。研究人员针对八种小型蛋白开展设计,目标是在保持原有折叠结构的同时提高热稳定性。结果显示,相比未经引导生成、后验筛选以及Fine-tuning,ProteinGuide在全部蛋白上均获得最高成功率,大多数生成序列不仅保持目标结构,而且预测稳定性优于天然蛋白。
随后,研究人员进一步利用ESM3完成三个不同蛋白家族的功能优化,包括CreiLOV荧光蛋白、UBE4B泛素连接酶以及PABP功能互补实验。为了模拟真实蛋白工程,仅利用约2000条实验测定序列训练预测模型,其余高性能序列全部隐藏。
结果表明,在三个任务中,ProteinGuide均产生最高比例的高性能蛋白。更重要的是,相比Fine-tuning生成序列主要集中在训练数据附近,ProteinGuide能够生成大量此前未出现的新序列,其预测性质甚至超过训练集中性能最好的蛋白,表现出真正的外推能力。与此同时,这些序列仍保持较高序列多样性和较大的突变距离,说明模型并非简单复制已有高性能蛋白,而是在天然蛋白空间之外发现新的优化方向。

图3: ProteinGuide在蛋白稳定性、荧光蛋白、泛素连接酶及功能蛋白优化中的性能比较。
ProteinGuide实现多目标蛋白设计
真实蛋白工程往往需要同时满足多个目标,而不同目标之间通常存在竞争关系。研究人员因此进一步选择铅离子感受蛋白PbrR开展多目标设计实验,希望同时提高铅离子结合能力并降低锌离子脱靶结合能力。
为了模拟真实设计流程,仅利用第一轮实验获得约1000个突变体建立预测模型,再分别预测Pb结合能力和Zn结合能力,并利用ProteinGuide联合两个预测模型同时引导生成。
实验结果显示,ProteinGuide生成的大约75%候选蛋白均落入预先设定的理想区域,而传统后验筛选仅约16%,Fine-tuning几乎无法突破原始训练数据形成的Pareto前沿。进一步分析发现,ProteinGuide不仅能够推动Pareto边界整体向更优方向移动,还能够根据不同设计需求灵活改变优化重点。例如,当研究人员希望进一步提高Pb结合能力时,模型能够自动增加相应方向的优化;而当重点转向降低Zn脱靶结合时,又能够重新调整生成策略,而无需重新训练生成模型。
研究人员认为,这种实时改变设计目标的能力特别适合设计—构建—测试—学习(DBTL)循环,可根据每一轮实验结果动态修改优化方向,大幅提高蛋白工程效率。

图4: ProteinGuide实现多目标Pareto优化及可控蛋白设计。
ProteinGuide结合实验反馈实现闭环蛋白工程
最后,研究人员将ProteinGuide应用于真实湿实验,优化腺嘌呤碱基编辑器(ABE)。
首先,研究人员分别利用ESM3和FMIF生成约2000个ABE变体,并通过细菌筛选实验测定实际编辑活性,建立预测模型。随后,利用ProteinGuide再次生成约2000个第二轮候选序列,并重新进行实验验证。
实验结果显示,第二轮ProteinGuide生成序列整体编辑活性明显高于第一轮,大多数序列均超过原始TadA,同时出现多个此前从未观察到的新型高活性编辑器。其中FMIF-1016和FMIF-1041表现尤为突出,在菌株实验和群体测序实验中均表现出极高编辑效率。
更重要的是,FMIF-1016编辑效率已经超过经典ABE7.10,而ABE7.10需要经过七轮定向进化才能获得。换句话说,仅依靠一次ProteinGuide设计和一次实验筛选,就获得了超过传统七轮进化才能达到的性能水平。这充分证明ProteinGuide能够真正替代部分传统定向进化过程,大幅缩短蛋白优化周期。
研究人员进一步分析发现,两种预训练模型产生的优化方向并不完全一致,说明ProteinGuide能够充分利用不同生成模型学习到的不同蛋白知识,因此未来还可进一步组合多个生成模型,实现更加丰富的设计空间探索。

图5: ProteinGuide结合实验反馈实现腺嘌呤碱基编辑器闭环优化流程及性能提升结果。
讨论
研究人员提出的ProteinGuide首次建立了蛋白质生成模型统一的在线性质引导框架,实现了预训练蛋白生成模型与实验预测模型之间的实时融合,而无需重新训练生成模型。这一设计突破了传统后验筛选效率低和Fine-tuning容易遗忘预训练知识两大瓶颈,使人工智能蛋白设计真正能够根据实验需求动态调整生成方向。
本研究另一项重要贡献在于,从理论上统一了掩码语言模型、任意顺序自回归模型、扩散模型以及Flow Matching模型,使ProteinGuide能够直接适配ProteinMPNN、ESM3、ESM Cambrian、MultiFlow等当前主流蛋白生成模型,为不同模型提供统一的性质控制机制。
在应用层面,ProteinGuide不仅显著提高蛋白稳定性、荧光强度和酶活性等单目标设计性能,还首次实现了多目标Pareto优化,在提高目标结合能力的同时降低脱靶作用,并进一步通过真实ABE工程验证了闭环设计能力。尤其值得注意的是,仅经过一轮ProteinGuide设计便获得性能超过七轮定向进化产生的碱基编辑器,充分体现了人工智能辅助蛋白工程的巨大潜力。
研究人员同时指出,ProteinGuide的性能仍依赖于性质预测模型的准确性。当预测模型训练数据较少或外推能力有限时,引导效果仍会受到一定限制。此外,目前框架主要针对蛋白序列生成,未来如果进一步结合蛋白结构生成模型、多模态蛋白语言模型、强化学习以及设计—构建—测试—学习循环,可望建立真正意义上的智能蛋白设计平台,实现蛋白稳定性、催化活性、结合特异性和可制造性的协同优化,为酶工程、治疗蛋白开发、基因编辑工具优化和合成生物学提供更加高效、灵活的人工智能设计范式。
整理 | DrugOne团队
参考资料
Xiong, J., Gaur, I., Lukarska, M. et al. Property guidance for protein sequence generative models with ProteinGuide. Nat Biotechnol (2026).
https://doi.org/10.1038/s41587-026-03207-z

内容为【DrugOne】公众号原创|转载请注明来源
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢