DRUGONE

过渡态决定化学反应的速率与反应路径,因此准确预测过渡态结构一直是计算化学中的核心问题。近年来,生成式机器学习模型在小型有机反应上已经能够获得很高的过渡态预测精度,但这些模型通常训练于以H、C、N和O为主的有限化学空间,其面对训练集中从未出现过的新元素、过渡金属或新型催化环境时是否仍然可靠,尚缺乏系统评估。


研究人员围绕这一问题构建了新的分布外过渡态基准,并以Transition1x为基础建立Transition1x-2p3p4p和Transition1x-TMC数据集。前者通过周期表同族元素替换构造轻度化学外推场景,后者引入10种具有催化意义的过渡金属,形成更具挑战性的有机金属反应空间。测试React-OT和AEFM后发现,即便反应机理和整体几何几乎不变,仅增加一种模型此前未见的元素,也会导致预测精度显著下降,并产生不合理键长甚至原子重叠。为此,研究人员提出基于平衡构象的自监督预训练方法,通过无需真实反应路径的“伪反应”提前让模型接触目标化学环境,再利用少量真实反应进行微调。该方法显著改善未见体系上的过渡态预测,并大幅降低微调所需的真实反应数据量。在Transition1x-TMC中,针对结构相近但包含新元素的反应,中位RMSD由0.39 Å下降至0.19 Å;在多个低数据场景中,预训练还可以减少最高约75%的真实反应数据需求。

过渡态在势能面上对应一阶鞍点,是连接反应物和产物并决定活化能的重要结构。传统过渡态搜索通常采用单端或双端优化方法:前者从初始猜测出发,通过梯度甚至Hessian信息逐步寻找鞍点;后者根据反应物和产物构建反应路径,再搜索路径上的高能区域。这些方法高度依赖初始结构质量,如果初始猜测较差,不仅需要大量优化步骤,还可能直接收敛失败。与此同时,过渡态搜索通常依赖密度泛函理论等电子结构计算,因此在大规模反应探索中的计算成本十分可观。


生成式机器学习提供了另一种思路,即直接根据反应物和产物预测可能的过渡态结构。React-OT通过流匹配和最优传输从插值结构出发生成过渡态,AEFM则通过收缩流逐渐把初始猜测推向合理的过渡态区域。这些方法在常用小分子数据集上表现优异,但训练数据主要局限于简单有机化学。对于催化、能源转化和材料合成中大量存在的硅、磷、硫、过渡金属等元素,现有模型实际处于明显的分布外状态。


因此,这项研究并非单纯追求在传统测试集上进一步降低误差,而是提出一个更基础的问题:生成式过渡态模型究竟学到了可迁移的反应规律,还是主要记住了训练化学空间中的原子类型和几何模式?



方法

研究人员以Transition1x为起点建立多个受控基准。Transition1x原始数据包含10,073个小型有机反应,主要由H、C、N和O组成。Transition1x-2p3p4p通过同族元素替换构造新的化学环境,例如C替换为Si或Ge、N替换为P或As、O替换为S或Se,并重新优化过渡态及相应反应物和产物;Transition1x-TMC则将原始反应结构作为有机配体,引入Ti、Zn、Ru、Rh、Pd、Ag、Os、Ir、Pt和Au等10种过渡金属,最终获得36,446个有机金属反应。 此外还建立含F和B的新型Transition1x-OOD,以及Rh催化乙烯反应和Pt催化甲烷活化数据,用于进一步测试跨化学空间泛化。模型采用React-OT和AEFM,并严格按照父反应划分训练和测试集,避免结构相关变体产生信息泄漏。 为改善泛化,研究人员从目标化学空间的平衡结构生成多个构象,将最高能构象视为伪过渡态、次高能构象视为伪反应物、最低能构象视为伪产物,由此构造不需要真实反应数据的自监督伪反应。模型先在这些伪反应上预训练,再用真实目标反应进行微调。评价主要考虑对齐后的结构RMSD、键距离误差和生成结构相对真实过渡态的能量偏差,并通过DFT重新优化检验生成结构是否能够作为可靠的过渡态初始猜测。



结果

新元素会导致生成式过渡态模型迅速失效

研究人员首先测试仅在HCNO化学空间训练的React-OT和AEFM。结果显示,模型对元素新颖性极其敏感。React-OT在原始HCNO反应上表现稳定,但一旦增加此前未见的原子类型,预测误差便迅速上升;当一个体系同时包含两类未见元素时,键距离误差进一步恶化。AEFM呈现出几乎相同的趋势。


为了排除“新元素同时改变了反应机理”这一因素,研究人员专门选择元素替换前后几何和反应机制几乎保持不变的反应。结果尤其具有说明性:Transition1x-2p3p4p中,对应HCNO反应的中位RMSD仅0.04 Å,但只替换一个原子后就升至0.18 Å;对于结构相近的过渡金属体系,HCNO类似物中位RMSD为0.05 Å,而加入过渡金属后达到0.39 Å。


这种失败不仅表现为整体RMSD增加,更反映在具体化学键上。模型能够正确生成训练中熟悉的C–C键长,却倾向于用类似C–C键的几何去描述C–Si或C–Ge相互作用,导致键长分布产生系统偏移。这说明模型对新化学环境的困难并不只是全局结构问题,而是其局部化学表示仍明显受训练集原子类型偏置影响。

图1:Transition1x-2p3p4p和Transition1x-TMC数据集的构建流程及元素组成,用于系统测试生成式过渡态模型面对未见元素和过渡金属时的泛化能力。


图2:React-OT在未见化学环境中的主要失败模式,包括随新元素数量增加而快速上升的几何误差,以及C–Si、C–Ge等新型键长的系统性偏差。


单纯扩大反应训练集并不能解决真正的化学外推

一个自然思路是让模型接触更多类型的真实反应。研究人员因此分别使用Transition1x-2p3p4p和Transition1x-TMC对模型进一步微调,再测试其对其他完全未见化学体系的泛化。


结果显示,这种策略并未解决根本问题。在Transition1x-OOD上,原始React-OT的中位RMSD为0.15 Å,而在更丰富的Transition1x-2p3p4p上微调后反而为0.19 Å。对于Pt和Rh催化反应,经过过渡金属数据训练的模型也没有表现出稳定优势。模型仍然倾向于根据训练中相似原子环境推断新型键长,而不是形成能够真正跨元素迁移的普适化学表示。


这意味着简单地增加“更多化学种类”并不必然带来真正的外推能力。只要测试体系仍包含训练阶段未覆盖的元素组合或反应环境,模型就可能再次遇到相同问题。因此,研究重点转向如何在没有大量真实过渡态数据的情况下,让模型提前学习新元素合理的三维结构模式。


利用平衡构象构建自监督伪反应

过渡态数据昂贵而稀缺,但平衡构象可以通过常规几何优化和构象搜索大量获得。研究人员利用这一差异构建自监督预训练框架。对于目标化学空间中的一个分子,首先生成多个平衡构象,再根据相对能量选取三个代表性结构:最高能构象作为伪过渡态,次高能构象作为伪反应物,最低能构象作为伪产物。


这些结构并不是真正的化学反应路径,也不要求存在断键或成键过程。其作用是为模型提供新元素在真实化学环境中的合理键长、局部几何和构象变化,从而使模型在接触真实目标反应之前先获得“化学适应”。训练流程由此变为两阶段:先使用目标领域平衡构象生成的伪反应进行自监督预训练,再利用数量有限的真实反应进行React-OT微调。

图3:基于平衡构象的自监督伪反应预训练流程,与直接使用真实反应数据训练React-OT的传统策略进行比较。


预训练显著改善未见元素上的预测并提高数据效率

伪反应预训练在两个主要基准上都显著改善了模型表现。在Transition1x-2p3p4p上,原始模型的中位RMSD为0.29 Å,能量误差高达196.99 kcal/mol;仅使用500个伪反应预训练后,RMSD降低至0.23 Å,增加到2,500个伪反应后进一步下降到0.22 Å,同时中位能量误差降至30.99 kcal/mol。


对于更加困难的过渡金属体系,这种改善更明显。Transition1x-TMC中原始模型中位RMSD约0.47 Å,使用500个伪反应后降至0.34 Å,使用2,500个伪反应后进一步降至0.32 Å,中位能量误差仅16.24 kcal/mol。针对那些与原始HCNO反应结构非常相近、主要区别只是元素不同的反应,预训练几乎将误差降低一半:Transition1x-2p3p4p由0.18 Å降至0.10 Å,Transition1x-TMC由0.39 Å降至0.19 Å。


更重要的是,自监督预训练显著提高了数据效率。Transition1x-2p3p4p中,经过预训练的模型仅使用完整真实数据的25%,就可以达到未经预训练、使用全部数据模型相近的表现;Transition1x-TMC则只需要约50%的真实数据。换言之,在部分任务中真实反应需求减少最高可达75%。


对于更加现实的小样本催化体系,这一优势仍然存在。Pt催化甲烷活化中,仅使用50个真实反应微调时,中位能量误差为9.04 kcal/mol;加入100个伪反应进行预训练后,在真实反应数量不变的情况下下降到5.06 kcal/mol。这表明模型性能改善并非单纯来自样本数量增加,而主要来源于目标体系平衡构象提供的化学归纳偏置。

图4:伪反应的构建方式,以及构象预训练对Transition1x-2p3p4p、Transition1x-TMC和Pt催化反应结构及能量预测精度的改善。


半经验数据能够支持高通量预测,但生成结果仍需DFT验证

由于构建数万条过渡金属反应的DFT数据成本极高,研究中的大规模数据主要使用GFN2-xTB计算。研究人员因此进一步检验,基于较低成本半经验方法进行领域适应后,模型生成结构是否仍与DFT势能面保持足够一致。


在Transition1x-2p3p4p、Transition1x-TMC、Rh和Pt催化数据上,GFN2-xTB和DFT对预测结构能量误差的总体趋势具有较好一致性,平均偏差低于25%,说明半经验方法可以作为大规模筛选和训练的经济数据来源。


进一步将生成的过渡态在DFT水平重新优化。Transition1x-2p3p4p中,188个预测结构成功收敛,其中75%最终达到对应参考DFT过渡态;Transition1x-TMC中93个结构成功收敛,其中82%匹配参考结构;Pt催化体系则达到76%的匹配率。


不过,模型本身并没有强制满足一阶鞍点条件。因此生成结构不能直接被视为已经严格验证的过渡态,而更适合作为传统量子化学优化的高质量初始猜测。研究的实际价值因此在于显著缩短搜索过程,而不是完全取代量子化学验证。

图5:GFN2-xTB与DFT层面的能量一致性,以及生成过渡态经DFT重新优化后收敛到参考过渡态结构的成功率。



讨论

这项研究揭示了当前生成式反应模型泛化能力中的一个关键问题:在传统随机划分测试集上获得很高精度,并不意味着模型真正理解了可迁移的化学规律。即使反应机理保持基本不变,仅将C替换为Si或Ge,模型也可能迅速失效。这种现象说明,现有生成式过渡态模型仍然强烈依赖训练数据中出现过的元素和键长分布,因此所谓“化学精度”很大程度上是训练域内性能,而不能自动推广为整个化学空间中的可靠性。


研究提出的构象预训练提供了一种非常实用的解决方向。其关键思想是把“学习化学环境”和“学习真实反应机制”部分分离。模型首先通过廉价且丰富的平衡构象学习新元素应该如何形成合理的三维结构和局部相互作用,然后再利用少量昂贵的真实过渡态数据学习具体反应过程。这种方式尤其适用于过渡金属催化等数据稀缺领域,因为这些体系的大规模DFT过渡态计算非常困难,而平衡构象相对容易获得。


但这一方法也存在明确边界。伪反应本质上只是不同平衡构象之间的人工排序,无法完整表示真实反应中的成键、断键、电子重排和远离平衡状态的势能面信息。因此,仅依赖近似平衡结构究竟能够学习多少真实反应路径信息,目前仍不清楚,未来需要研究伪反应预训练随数据规模增长是否存在性能上限。


此外,高质量DFT反应数据的极度稀缺仍然是限制基础反应模型发展的核心瓶颈。研究人员因此提出更具现实性的混合数据策略:利用GFN2-xTB等低成本方法大规模覆盖化学空间,再针对模型不确定性最高的区域选择性进行DFT计算。如果进一步结合基于不确定性的主动学习,模型可以主动发现自己最不熟悉的化学环境,再把有限的高精度计算预算集中到最有价值的样本上。


因此,这项工作的意义不仅在于提高React-OT在几个新数据集上的精度,更在于重新定义生成式过渡态模型的训练目标:未来真正具有实用价值的模型不能只是对训练化学空间进行高精度插值,而应能够在面对新元素、新催化剂和新反应环境时保持稳定,并以极少量高成本反应数据完成快速领域适应。基于广泛平衡结构预训练、少量真实反应微调以及高精度量子化学验证的组合,有望成为构建跨化学空间生成式反应基础模型的一条可行路径。

整理 | DrugOne团队


参考资料


Darouich, S., Toney, J.W., Luo, W. et al. Robust generative transition-state models for unseen chemistry. Nat Comput Sci (2026). 

https://doi.org/10.1038/s43588-026-01034-5

内容为【DrugOne】公众号原创转载请注明来源

内容中包含的图片若涉及版权问题,请及时与我们联系删除