DRUGONE
非核糖体肽合成酶(non-ribosomal peptide synthetases,NRPSs)能够合成大量具有药理活性的天然产物,包括多种抗生素、免疫抑制剂和抗肿瘤分子。然而,NRPS本质上是高度动态的多结构域“装配线”,其催化依赖不同结构域之间短暂而且具有状态依赖性的相互作用,因此传统的结构域替换往往导致活性下降甚至完全失活。研究人员利用生成式蛋白模型 ESM3、ProteinMPNN 和 EvoDiff,结合“设计–构建–测试–学习”循环,尝试直接生成能够适应特定 A–T–C 局部环境的全新硫醇化结构域(T-domain,也称肽基载体蛋白结构域)。最终共设计76个全新T结构域,并构建和实验测试578个重组NRPS变体,覆盖最小体系、完整装配线、不同位置替换以及杂合NRPS。
结果显示,多个AI设计T结构域能够支持正常肽产物形成,一些变体甚至将产率提高到天然T结构域的约3倍。代表性设计AI-2表现出更好的可溶性表达、折叠恢复能力以及约12 °C更高的熔解温度。分子动力学模拟显示,其整体折叠稳定性与天然结构域相近,但不同催化状态下的结构域间接触网络被重新组织。更重要的是,这些设计的功能具有明显环境依赖性:某个T结构域在一个位置表现良好,并不意味着可以在其他位置或其他下游缩合结构域环境中保持活性。研究表明,生成式AI可以用于设计适应特定局部催化环境的载体结构域,为NRPS重编程和新型天然产物生物合成提供新的工程策略。

蛋白质工程长期面临一个核心问题:蛋白序列空间极其庞大,而真正具有目标功能的序列十分稀少,实验筛选成本却很高。对于NRPS这样的巨型多结构域酶,这一问题更加突出。典型NRPS模块通常包含负责底物选择和活化的腺苷酸化结构域(A-domain)、负责携带反应中间体的T结构域,以及负责形成肽键的缩合结构域(C-domain)。部分C结构域还兼具差向异构功能,而最终产物通常由硫酯酶结构域释放。
T结构域虽然体积相对较小,却处于整个催化循环的中心。它通过4′-磷酸泛酰巯基乙胺臂携带底物,并在催化过程中不断与上游A结构域、下游C结构域以及相邻模块发生接触。这些相互作用并非固定,而会随着底物装载、供体转移和受体缩合等催化状态发生变化。因此,NRPS不是由可随意互换的模块组成,而更像一个依赖精确动态通信的分子机器。
过去的NRPS工程策略通常依据天然进化关系或已知结构域边界进行重组,例如保留更加兼容的结构域连接界面。虽然这些策略已经显著提高了成功率,但新的拼接点依然会产生非天然界面,导致催化效率下降。研究人员因此提出一个更进一步的问题:生成式AI是否能够直接在目标上下游结构域环境中生成新的T结构域,使其从设计阶段就适应该局部催化邻域,而不是先生成一个“通用”结构域再寻找可用位置。
方法
研究人员以GameXPeptide synthetase(GxpS)为主要实验平台。GxpS可被拆分成两个通过人工卷曲螺旋“拉链”重新组装的Type S体系,其中下游SU2片段可以单独产生线性三肽,也可以与SU1重组形成完整五模块装配线并产生环状五肽。研究人员在T3位置建立Golden Gate高通量替换体系,以便快速插入候选T结构域。AI设计时保留目标T结构域上下游的A结构域和C结构域序列或结构信息,并将T结构域区域遮蔽后重新生成,从而让ESM3、ProteinMPNN和EvoDiff在指定局部A–T–C环境中产生候选序列。第一轮主要直接测试生成结果;第二轮加入保守PPant结合基序、序列相似性和蛋白语言模型困惑度等筛选条件;第三轮则进一步利用前两轮和误差易感PCR获得的实验数据训练代理模型,对新候选进行优先级排序。最终候选首先在SU2最小体系中进行快速筛选,再进入完整NRPS、位置替换、杂合装配线以及生化和分子动力学验证。

图1|基于Type S GxpS平台的AI硫醇化结构域设计、Golden Gate快速交换以及“设计–构建–测试–学习”实验流程。
结果
生成式AI能够直接产生具有催化功能的T结构域
研究人员首先在SU2最小体系中测试AI生成序列。三轮设计共测试66个AI设计T结构域,并以天然GxpS_T3活性设为100%。第一轮中,4个ESM3设计全部产生可检测产物,其中AI-2甚至达到约115%的天然水平;ProteinMPNN设计中则只有部分具有活性。分析显示,能否保留靠近PPant修饰位点的关键局部残基,与下游C/E结构域背景具有明显关系。
第二轮开始加入更明确的序列过滤,要求候选保留包含催化丝氨酸的保守基序,同时与天然T3保持至少50%的序列一致性,并具有较低的ESM2困惑度。第三轮又加入实验数据驱动的代理模型。随着DBTL循环推进,达到至少50%天然活性的功能序列比例逐渐提高,说明实验反馈能够帮助生成与筛选策略收敛到更可靠的序列区域。
但一个重要发现是,序列相似度本身并不能可靠预测功能。例如AI-27与天然T3约70.4%相同,却达到约163%的产量;而AI-5约64.3%相同,却完全失活。这说明T结构域功能更多取决于具体局部界面组织,而不是简单“越像天然序列越好”。

图2|三轮DBTL过程中AI生成T结构域在最小NRPS体系中的活性分布和功能序列比例变化。
AI设计序列可以成为后续定向进化的更优起点
为了比较生成式设计与传统局部突变策略,研究人员分别对天然T3和AI-2、AI-12、AI-15进行误差易感PCR突变。不同起始骨架表现出非常明显的可进化性差异。天然T3突变库中只有24%的变体超过天然水平,而AI-2突变库中约60%的变体超过天然T3。更重要的是,整个研究中活性最高的变体123正来自AI-2骨架,其产量达到天然T3的285%。相比之下,不同AI骨架的突变结果差异很大,说明生成式设计不仅可以直接提供功能序列,还可能产生比天然序列更适合进一步局部优化的“进化起点”。
这一结果提示,生成式AI与定向进化并不是竞争关系。AI可以首先跳出天然序列周围的局部空间,找到新的功能骨架,再利用传统突变进一步精细优化。
AI设计T结构域在完整NRPS装配线中仍保持功能
最小体系中的活性并不能保证完整装配线中的功能,因为完整NRPS要求T结构域依次与更多上游和下游结构域发生状态依赖性接触。因此,研究人员从三轮设计中挑选8个代表性高活性T结构域,重新放入完整五模块GxpS系统。
所有8个变体都能够生成目标环状五肽,说明全新T结构域可以真正嵌入完整NRPS催化循环。AI-27的产量达到天然体系的257%,约7.4 mg L⁻¹;AI-38则达到144%。值得注意的是,一些序列在最小体系中的相对优势在完整体系中进一步扩大,说明简化筛选系统与完整装配线之间并非线性对应。
培养条件同样显著影响测得产量。例如天然GxpS在succinate XPP中约为2.9 mg L⁻¹,而相同体积的LB培养中可以达到约50 mg L⁻¹。部分AI变体在不同培养体积和培养基中的相对排名也发生变化。因此,研究人员强调,产量应该被理解为特定培养条件下的功能标签,而不是完全独立于实验环境的固有序列属性。

图3|AI设计T结构域在完整五模块GxpS装配线中的产物形成能力,以及不同培养规模和培养条件下的产量表现。
AI-2表现出更好的表达、折叠和热稳定性
AI-2是第一轮中最早超过天然活性的设计,因此被用于深入生化表征。与天然GxpS_T3相比,AI-2在大肠杆菌中表达水平更高,而且能够大量存在于可溶性组分中;天然T3则主要形成不溶性蛋白,需要变性纯化。
在重新折叠实验中,天然T3大部分发生聚集,而AI-2能够较好恢复天然样SEC峰。热变性实验进一步显示,AI-2熔解温度约为52 °C,而天然T3约为40 °C,提高约12 °C。类似的可溶性优势也存在于包含AI-2的多结构域构建体中。
不过,研究人员并未将“更稳定”简单等同于“产量更高”。AI-2在不同装配线环境下并不总是最优,说明T结构域的内在折叠稳定性与装配线功能是两个相关但不同的问题。

图4|AI-2与天然GxpS_T3在蛋白表达、可溶性、重新折叠能力和热稳定性方面的比较。
分子动力学揭示状态依赖的结构域间相互作用重排
为了理解AI-2为何能保持功能,研究人员对天然T3和AI-2分别建立三种催化状态模型,并进行100 ns全原子分子动力学模拟,包括T结构域与A结构域作用的硫醇化状态、向下游C/E结构域递送底物的缩合供体状态,以及与上游C结构域相互作用的缩合受体状态。
两种T结构域在所有状态中整体结构都较稳定,T结构域核心RMSD约为1.5–1.8 Å,说明AI-2并没有通过显著改变整体折叠发挥作用。真正不同的是结构域间接触网络。天然T3在硫醇化状态下与A3形成更加分散的界面,而AI-2的接触更多集中在螺旋2;在缩合供体状态下,AI-2形成更多极性和氢键相互作用;在受体状态下,天然T3则保持更多持续接触。
因此,AI设计主要改变的可能不是“结构是否稳定”,而是不同催化阶段下界面接触如何重新分配。这与NRPS载体结构域依赖多个弱而瞬时相互作用完成动态切换的机制相吻合。

图5|天然T3和AI-2在硫醇化、缩合供体和缩合受体三种催化状态中的结构域间接触网络变化。
T结构域功能具有明显的位置依赖性
研究人员随后把AI-2、AI-12和AI-38从原始T3位置分别移动到T1、T2、T4和T5,测试同一个设计能否作为“通用模块”使用。
结果显示不同位置之间差异巨大。在T1位置,AI-2和AI-12完全失活,AI-38仅保留约24%活性;T2位置也整体不利。但在T4和T5位置,部分设计反而表现优异。例如AI-12在T4达到天然水平的约137%,在T5达到约272%;AI-2在T5也达到约216%。相反,AI-38在部分位置完全失活。
进一步分析发现,这种位置依赖主要与T结构域下游C结构域类别有关。原始T3之后连接的是双功能C/E结构域,而T2后方是另一类L_CL型C结构域,两类结构域具有不同的催化和立体化学要求。因此,在C/E环境中设计出的T结构域往往不能直接迁移到L_CL环境。

图6|AI设计T结构域移植到GxpS不同模块位置后的活性变化,显示明显的局部环境和位置依赖性。
AI设计T结构域能够支持杂合NRPS重编程
研究人员最后构建多个跨天然系统的杂合NRPS,将GxpS模块与XtpS和SzeS来源模块重新组合,从而创造更具挑战性的非天然A–T–C界面。
在第一个GxpS–XtpS杂合体系GxhS-1中,天然GxpS_T3几乎不能产生目标四肽,而AI-2、AI-27和AI-31使产物峰面积提高超过两个数量级。另一个GxpS–SzeS杂合体系中,AI-2和AI-12分别使主要产物相对于天然T结构域增加约25%和65%。
研究人员又专门针对L_CL型下游C结构域重新生成AI-67至AI-76,并在GxhS-2中测试。部分新设计将产物峰面积提高到天然T2的大约两倍,而原先针对C/E环境生成的大多数设计在这一体系中失活。进一步对全部76个AI设计在多个体系中进行高通量测试后,下游C结构域类别成为最明显的兼容性决定因素。序列系统发育分析也显示,C/E环境设计和L_CL环境设计分别聚集到具有对应天然下游伙伴的序列区域。
这说明生成模型并非简单产生一般意义上的“稳定T结构域”,而能够在给定上下文条件下生成具有一定伙伴偏好的序列。

图7|AI设计T结构域在GxpS–XtpS和GxpS–SzeS杂合NRPS中的功能验证,以及不同下游C结构域背景对兼容性的影响。
讨论
这项工作的核心价值在于把生成式蛋白设计从相对独立的单蛋白功能问题推进到动态多结构域酶系统。NRPS工程长期困难的根源并不是结构域本身不能工作,而是结构域在装配线中的功能依赖多个短暂、状态相关的界面。研究人员因此没有要求模型生成一个“普适T结构域”,而是直接把上下游A和C结构域作为生成条件,让设计从一开始就针对目标局部环境。
实验结果也反复说明,局部环境比序列相似度更重要。与天然T结构域序列接近并不能保证功能,而一个在T3位置非常有效的AI设计也可能在T1或T2完全失活。最关键的因素之一是紧邻下游C结构域的类别。针对C/E环境生成的设计更倾向在C/E环境中工作,而针对L_CL环境生成的序列则表现出相反偏好。这提示未来NRPS生成设计应把“连接到谁”作为显式输入,而不是把载体结构域视为独立模块。
另一方面,AI-2显示生成模型还可能意外改善蛋白的工程可开发性,包括可溶性、重新折叠能力和热稳定性。但这些性质并不能完全解释装配线产量,说明NRPS工程必须同时考虑结构域本身的稳定性与结构域间动态通信。
研究也存在明确限制。当前生成模型并没有被证明真正显式学习了A–T–C界面的物理相互作用;更准确地说,它们是在上下文条件下生成序列,而实验结果表明这些条件确实包含与局部兼容性相关的信息。分子动力学结果也主要用于产生机制假设,而不能单独证明特定接触变化导致活性差异。此外,产量标签受到培养基、规模和细胞生理状态影响,因此更大规模、标准化、多环境数据仍是建立真正预测性模型的关键。
总体来看,这项研究证明生成式AI可以为NRPS设计全新的功能性T结构域,并通过局部环境条件实现一定程度的伙伴特异性。其意义不仅在于获得更高产量,而在于提供了一种新的装配线工程思路:不再只寻找天然结构域之间“可以拼接的位置”,而是直接生成适合目标连接环境的新结构域,从而为构建新型杂合NRPS和生产新天然产物提供更灵活的设计空间。
整理 | DrugOne团队
参考资料
Bülbül, E.F., Bang, S., George, K. et al. Generative AI designs functional thiolation domains for reprogramming non-ribosomal peptide synthetases. Nat Commun 17, 10084 (2026).
https://doi.org/10.1038/s41467-026-77963-6

内容为【DrugOne】公众号原创|转载请注明来源
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢