本文介绍一篇由晨伫(MoMeD)生物科技、浙江大学、浙江省人民医院、中国科学院大学杭州高等研究院和南加州大学联合团队在Journal of the American Chemical Society发表了题为“An Explicit Interaction-Prompted Diffusion Framework for High-Fidelity 3D Molecular Generation”的研究论文,晨伫生物科技的白晨、浙江大学的侯廷军和南加州大学的Arieh Warshel为并列通讯作者,杜华斌、王明阳和罗梦琪为共同第一作者。该研究提出显式相互作用提示扩散框架 EIP-Diff,并构建包含45,318个实验解析蛋白-配体复合物的CrystalDataset,将残基级生物学相互作用直接融入3D分子生成过程,在真实结合模式复现、可控分子设计和IDO1候选分子活性验证中展现出优异性能,最终获得IC50达0.31nM的候选化合物,为高保真、可解释的结构驱动药物设计提供了新的计算框架。


研究背景

基于结构的药物设计是 AI 药物研发的重要方向。近年来,靶点感知的3D分子生成模型能够依据蛋白口袋从头设计候选小分子,但多数方法仍主要依赖隐式学习:模型从训练数据中自行归纳结合模式,而非被明确告知哪些残基相互作用和空间约束必须被满足。当训练数据包含人工对接带来的系统偏差时,模型容易将统计捷径误认为真实规律,表现为计算指标较高,却难以稳定复现可信的三维结合构象。


研究团队将这一问题概括为“算法偏差放大”:有偏数据与隐式学习架构相互耦合,使模型倾向重复生成容易优化评分的简单骨架,而非学习真实的蛋白-配体识别机制。针对这一痛点,团队开发了EIP-Diff,将真实晶体结构数据和残基级相互作用先验同时纳入扩散生成过程,推动模型由“隐式猜测结合模式”转向“显式遵循相互作用约束”。


方法概述

为提高靶点特异3D分子生成的几何可靠性与可控性,研究团队构建了由高保真数据、显式交互架构和两阶段学习策略组成的 EIP-Diff 框架。


高保真 CrystalDataset 构建

针对常用 Crossdocked 数据集存在的人工重组和对接偏差,团队基于BioLiP2 构建了 CrystalDataset。该数据集收录45,318个实验解析的蛋白-配体复合物,保留天然蛋白-配体配对、原生三维构象及残基级相互作用注释,为模型提供更接近真实结合环境的结构监督。


2.EIP-Diff 核心架构

EIP-Diff 采用SE(3)等变扩散框架,在原子坐标更新过程中保持旋转和平移等变性。模型首先通过全局自注意力,在蛋白-蛋白、蛋白-配体和配体-配体等异质连接上整合空间与化学信息;随后通过交互提示引导的交叉注意力,将氢键、卤键、阳离子-π、π-π堆积等残基级相互作用编码为可学习提示,并沿“蛋白到配体”的方向更新配体原子。


这一设计使相互作用信息具备双重作用:训练时,它是降低捷径学习风险的显式生物学先验;推理时,它又可作为设计指令,要求分子在指定残基位置形成特定相互作用,从而提升生成过程的可控性和可解释性。


两阶段训练策略

模型首先在3D ZINC 数据上预训练,学习分子化学有效性与基础三维构象;随后在 CrystalDataset 或 Crossdocked 数据上微调,使模型适应口袋特异的构象和相互作用模式。该策略将基础化学学习与复杂结合几何学习分开,为后续的靶点条件生成建立稳定基础。

图 1. EIP-Diff 总体框架。


结果与讨论

Crossdocked 数据偏差会削弱真实结合模式学习

研究团队首先对比了 Crossdocked2020 与实验晶体数据。结果显示,Crossdocked 中分子的平均重复次数为 11.52,而晶体数据仅为 1.67;人工交叉配对和对接还会破坏口袋与配体间的自然体积互补关系。在相互作用层面,ILE 残基的氢键概率被抬高约 12%,2.75-3.5 Å 的非物理氢键距离被过度表示,而卤键等重要相互作用则被系统性低估。这些偏差会向模型传递失真的监督信号,促使模型通过重复简单芳香骨架来优化 QED、SA 等表观指标,而非学习真实的结合几何。


图 2. CrystalDataset 与 Crossdocked 数据在分子重复、理化性质、口袋匹配及相互作用分布等方面的比较。


高保真数据释放 EIP-Diff 的三维生成潜力

在有偏的 Crossdocked 数据上训练时,EIP-Diff 已表现出较强的分布稳健性:Struct-DCS为0.951、Pharma-DCS为0.920,重复分子比例RMR_1仅为0.5%,分子唯一性达到99.7%,化学空间重建率和探索率分别为99.8%和38.7%。这表明显式架构可在一定程度上抵抗模式坍塌和指标膨胀。


当模型训练数据切换为 CrystalDataset 后,三维结构保真度得到显著提升:3D ShapeSim Top-1 Dominance 从8.1%提升至40.4%,Struct-DCS 提升至0.961,Pharma-DCS 提升至0.943。进一步加入真实相互作用提示后,3D ShapeSim Top-1 Dominance 达到47.5%,Struct-DCS 达到0.968,分子唯一性达到99.9%,化学空间覆盖率达到100%。在含有11个已知相互作用的复合物中,提示条件相较无提示生成的成功率最高提升64%,说明该机制可将明确的生物学约束有效转化为分子生成能力。

图 3. 不同模型的药理属性与原子组成分布,以及不同交互提示数量下的生成成功率。


KAT6A 结合模式复现与 YTHDC1 从头优化

为验证模型对复杂结合几何的把握能力,团队在KAT6A和YTHDC1两个靶点上开展案例研究。在 KAT6A(PDB:6OIO)体系中,EIP-Diff 的三维结构相似度达到0.467。生成分子能够保留参考配体的酰基磺酰肼核心,并与Ser690、Arg655、Gly659、Arg660 等关键残基维持氢键,同时以疏水取代基填充相应口袋,较好复现原生结合模式。


在 YTHDC1(PDB:8K2E)从头优化任务中,研究团队基于参考配体相互作用提示生成并筛选约30,000个候选分子。最优设计分子不仅保留了参考配体的关键结合模式,还形成了与SER362和SER378的新增稳定氢键。分子动力学模拟与 MM/PBSA 计算显示,其结合自由能为-36.43±1.41 kcal/mol,优于参考分子的-26.02±1.08 kcal/mol。

图 4. EIP-Diff 在 KAT6A 中的原生结合模式复现,以及在 YTHDC1 中基于相互作用提示的候选分子优化。


IDO1骨架跃迁与细胞水平活性验证

团队进一步选择具有动态结合过程的IDO1开展前瞻性骨架跃迁设计。以BMS-986205的保留片段为锚点,EIP-Diff 在被掩蔽区域生成了30,000个独特候选分子,再结合分子对接、合成可及性和 QED 等多参数筛选,获得两种候选化合物。结构叠合表明,两种候选分子均能保持与参考抑制剂相近的构象,并保留酰胺基团相关的关键氢键。


在 IFN-γ诱导的 HeLa 细胞IDO1抑制实验中,两种候选化合物的IC50分别为 0.75nM和 0.31nM;其中活性最强的候选分子与阳性对照的0.29 nM接近。该结果为 EIP-Diff 从计算设计到实验活性验证提供了直接支撑,也显示出其处理复杂动态口袋和执行定向骨架跃迁的潜力。


图 5. IDO1 骨架跃迁设计策略、两种候选分子的结构与参考抑制剂的三维叠合,以及细胞水平 IDO1 抑制活性结果。


总结

EIP-Diff 提出了一条以“显式相互作用约束 + 高保真晶体数据”为核心的 3D 分子生成路径。相较于完全依赖隐式统计学习的生成模型,该框架将残基级相互作用直接嵌入扩散去噪过程,既提高了生成分子与真实药理和结构分布的一致性,也让研究人员能够以关键相互作用为条件进行更可控的局部优化。

CrystalDataset 对模型性能的提升进一步说明,数据质量与模型架构同样决定生成式 AI 在药物设计中的实际可靠性。结合 KAT6A、YTHDC1 的结构案例和 IDO1 的细胞水平活性验证,EIP-Diff 展现出从结合模式复现、相互作用优化到候选化合物设计的应用潜力,可为结构驱动的先导优化和骨架跃迁提供新的计算工具。

参考资料

Huabin Du, Mingyang Wang, Mengqi Luo, Mengke Yang, Yingchao Yan, Ke An, Xiaohong Zhu, Arieh Warshel, Tingjun Hou, Chen Bai; An Explicit Interaction-Prompted Diffusion Framework for High-Fidelity 3D Molecular Generation. Journal American Chemical Society 2026; 

https://doi.org/10.1021/jacs.6c08189

图 5. LaMGen在双靶标体系中的回溯性验证。


图 6. LaMGen在三靶标体系中的回溯性验证。


总结

LaMGen 为多靶点 3D 分子生成提供了基于大语言模型的新型技术路径。 该框架能够直接从目标蛋白氨基酸序列出发,快速生成兼具量子力学构象精度、高多靶点亲和力且满足成药性指标的 3D 活性分子,有效平衡了模型泛化性、计算精度与运行效率。作为面向多靶点药物设计的 LLM 基础生成框架,LaMGen 在零样本场景下表现出可靠的泛化能力,能够适配功能协同靶点等多种复杂设计需求。随着与蛋白结构及性质预测模型的深度融合,LaMGen有望为 AI 驱动多靶点药物研发提供有力工具,在针对复杂疾病的多靶点药物开发中发挥作用。

参考资料

Su, Q., Gou, Q., Zhang, H. et al. LaMGen: LLM-based 3D molecular generation for multi-target drug design. Nat Commun 17, 5091 (2026). 

https://doi.org/10.1038/s41467-026-71737-w

内容中包含的图片若涉及版权问题,请及时与我们联系删除