DRUGONE
过渡态是化学反应势能面上的关键鞍点,其结构直接决定反应速率、活化能以及化学选择性和立体选择性,因此准确定位过渡态是理解有机反应机理和开展理性催化剂设计的重要基础。然而,过渡态具有瞬时存在、结构高度敏感和构象空间复杂等特点,传统量子化学计算通常需要研究人员依靠化学经验手工构建合理的三维初始结构,再经过反复调整和优化才能找到正确的过渡态。这种高度依赖专家经验的过程已经成为自动化反应机理研究的重要瓶颈。现有生成式人工智能虽然开始用于过渡态结构生成,但主要集中于元素组成简单、分子尺寸较小的反应体系,难以直接处理过渡金属催化等真实有机合成场景。
为解决这一问题,研究人员建立了一个面向通用过渡态生成的统一框架。首先,从346篇有机合成研究的补充信息中自动提取超过10,000个量子化学计算结构,经过统一的密度泛函理论优化、频率分析和结构验证,最终构建包含4,391个高质量过渡态的UniTS-Lib。该数据库覆盖42种元素、多种有机反应类型以及中性、阳离子、阴离子和自由基体系,并包含大量过渡金属催化反应和大尺寸复杂结构。在此基础上,研究人员开发UniTS-Gen条件扩散模型,其核心为高阶SE(3)等变图神经网络HiEGNN,仅需要反应物二维分子图和反应位点信息,即可从随机坐标直接生成三维过渡态结构。
UniTS-Gen在UniTS-Lib、Transition1x和[3+2]环加成数据集上均表现出较高的结构准确性。在复杂UniTS-Lib中,HiEGNN生成结构的碰撞率仅为3.9%,而普通EGNN达到66.4%。对于训练中未出现的分子组成,模型仍保持较强泛化能力。更重要的是,在Formula-OOS测试集上,仅使用单次随机生成结果作为量子化学初始结构,就有68.7%的体系成功收敛至一阶鞍点,其中41.9%最终被验证为目标反应过渡态。模型还能够探索不同反应位点、不同立体构型以及具有反应路径分叉特征的ambimodal过渡态,从而将AI过渡态生成从简单结构预测推进到真实有机合成中的动力学选择性分析和反应机理探索。

在计算有机化学中,过渡态并不是普通的稳定分子结构,而是连接反应物和产物的高能一阶鞍点。其几何结构中的微小变化就可能显著改变反应能垒,并最终决定不同反应路径之间的动力学竞争。因此,在不对称有机金属催化、手性自由基化学以及生物正交化学等精密合成领域,过渡态分析已经成为解释反应活性和选择性的核心手段。
问题在于,量子化学方法虽然可以对一个已经比较接近真实过渡态的结构进行优化,却很难凭空找到正确的过渡态。实际研究中,化学家通常需要根据反应机理提出候选路径,确定可能形成和断裂的化学键,再凭借经验手工搭建多个三维初始构象,随后分别进行过渡态优化和频率计算。如果初始结构偏离正确鞍点过远,优化就可能失败、收敛到稳定中间体,或者得到与目标反应无关的构象变化。面对大型配体、过渡金属中心以及多种可能构象和立体构型时,这种试错过程尤其耗时。
生成式AI为这一问题提供了新的解决方案。此前研究已经证明扩散模型可以学习过渡态三维几何,但这些方法往往依赖反应物和产物的三维结构,而且训练数据集中分子通常较小、元素种类有限。对于真正的合成化学问题,特别是包含过渡金属、复杂配体、离子和自由基的大分子体系,这种训练分布与实际应用之间存在明显差距。研究人员因此认为,要建立真正通用的AI过渡态生成系统,需要同时解决两个问题:一方面必须建立覆盖真实有机反应、复杂元素组成和广泛分子尺寸的高质量过渡态数据库;另一方面需要发展表达能力足够强的三维生成模型,使其能够从相对有限的数据中学习复杂过渡态几何,并泛化到训练过程中从未见过的化学空间。
方法
研究人员首先建立自动化数据收集流程,从346篇涉及有机反应机理研究的文献补充信息中提取原子类型和三维坐标,将不同来源的数据统一转换为标准量子化学输入,同时保留中性、阳离子、阴离子和自由基等不同电子状态。超过10,000个候选结构随后接受统一水平的DFT过渡态优化和频率分析,并结合分子图匹配判断所得一阶鞍点是否真正对应化学键形成或断裂,而非简单构象变化,最终得到4,391个高质量结构并构建UniTS-Lib。 在此基础上开发的UniTS-Gen以反应物二维分子图及指定反应位点的原子索引作为条件输入,通过二维图编码器获得分子拓扑和反应中心信息,再利用拓扑增强标量特征TASF将二维信息注入三维等变表示。模型从随机原子坐标开始,通过以HiEGNN为去噪核心的条件扩散过程逐步恢复三维结构。HiEGNN采用高阶SE(3)等变表示,使模型能够更加精细地描述过渡态中复杂的方向关系和畸变几何,同时保证旋转和平移条件下的物理一致性。 最后,研究人员在UniTS-Lib、Transition1x和[3+2]环加成数据集上进行测试,并设置未见分子组成、未见元素以及超过训练集最大尺寸等分布外测试,同时将AI生成结构进一步用于DFT优化、反应能垒计算和动力学模拟。
结果
构建面向真实有机合成的复杂过渡态数据库UniTS-Lib
建立通用过渡态模型首先受到数据质量和化学空间覆盖范围的限制。研究人员从346份文献补充信息中自动获得超过10,000个量子化学输入结构,但经过严格的统一DFT优化和验证后,最终只有4,391个结构进入UniTS-Lib。这种明显的数据损耗本身说明,即使起始坐标来自已经发表的机理研究,过渡态优化仍然对初始几何、泛函和基组等计算条件高度敏感。
UniTS-Lib最大的特点是复杂性和多样性。数据库覆盖超过10类与有机反应机理研究密切相关的转化,包括氧化加成、转金属化和环加成等;共包含42种元素,最高原子序数达到79,即金元素。除常见主族元素外,铁族和铂族等催化化学中的重要过渡金属也得到充分覆盖。
数据库同时包含中性、阳离子、阴离子和自由基过渡态,各类体系的原子数量中位数约为50。中性体系的尺寸分布最广,最大达到231个原子,整个数据库中共有131个结构超过150个原子。与Transition1x和[3+2]环加成数据集相比,UniTS-Lib具有更高的元素多样性和更大的分子尺寸跨度,从而更接近真实有机合成中的复杂反应空间。

图1|用于自动化过渡态发现的统一框架。

图2|UniTS-Lib的元素组成与结构复杂性。
UniTS-Gen从二维分子图直接生成复杂三维过渡态
传统生成模型往往需要提供反应物和产物的三维几何,这在已知反应中比较容易实现,但对于真正需要进行机理探索的新反应并不理想,因为产物结构甚至反应路径本身可能尚不明确。因此,UniTS-Gen将输入简化为反应物或中间体的二维分子图,并附加指定反应位点的原子索引。不同的反应位点条件可以引导同一个反应物生成不同反应路径对应的过渡态。
模型核心HiEGNN并非只处理简单标量或向量特征,而是通过高阶等变表示捕获复杂三维方向信息。二维图编码得到的分子拓扑信息则通过TASF进入等变网络,使模型在从随机坐标逐步去噪的过程中始终受到化学连接关系和反应中心的约束。因此,二维图决定“是什么分子以及在哪里反应”,而扩散过程负责探索“这些原子在过渡态中如何排列”。
这种设计还赋予模型天然的多构象生成能力。相同二维输入可以生成多个三维候选结构,从而覆盖不同构象和构型,而不是给出唯一确定答案。这一点对于过渡态尤其重要,因为真实反应往往存在多个相互竞争的构象,而其中最低能量结构才可能主导实验观察到的选择性。

图3|UniTS-Gen条件扩散模型的架构。
高阶等变网络显著提高复杂过渡态的结构合理性
研究人员首先在UniTS-Lib上按照8:1:1划分训练、验证和测试集。一个代表性的钯催化C–H活化反应展示了模型的多构象能力:对于完全相同的二维分子图,第一次生成得到与参考结构构型不同但化学合理的结构,RMSD为1.47 Å;第二次采样则几乎重现参考构型,RMSD降低至0.12 Å。更重要的是,两种结构中反应中心关键原子间距离都与真实过渡态高度接近,因此均具有作为后续DFT优化初始猜测的潜力。
相比之下,将HiEGNN替换为普通EGNN后,复杂分子容易发生严重结构坍缩。一个有趣的问题是,坍缩结构的RMSD甚至可能低于化学合理但构象不同的生成结构,因此单纯使用RMSD无法充分评价复杂过渡态生成。研究人员由此进一步引入“碰撞率”,用于衡量存在不合理原子间距离的生成结构比例。
差异在UniTS-Lib上尤其明显:HiEGNN与EGNN的平均RMSD分别为1.07 Å和1.34 Å,看起来差距有限,但HiEGNN的碰撞率仅为3.9%,普通EGNN却高达66.4%。这表明高阶三维等变表示真正改善的是复杂结构的物理合理性,而不仅仅是坐标层面的平均误差。对于分子更小、元素种类更少的Transition1x和[3+2]环加成数据,普通EGNN已经能够取得较好结果,但HiEGNN仍保持精度优势。
研究人员随后进一步构建三个严格的分布外测试:Formula-OOS包含训练中从未出现过的元素组合,Element-OOS包含完全未见过的元素,Maximum-OOS则包含尺寸超过训练集中最大分子的结构。Formula-OOS上的平均RMSD达到1.15 Å,碰撞率仅1.5%,接近随机划分测试集,说明模型能够较好泛化至由已知元素构成、但分子组成完全不同的新型有机反应。对于更加困难的Element-OOS和Maximum-OOS,性能有所下降,表明完全未知元素和超大分子仍然是当前模型的主要挑战。
更具实际意义的是DFT验证。在Formula-OOS中,不进行额外筛选或启发式约束,仅采用一次随机生成的结构作为初始猜测,就有68.7%成功收敛到一阶鞍点;进一步排除只涉及基团旋转等非反应性过渡态后,41.9%的全部测试体系最终被确认是真正的目标反应过渡态,并全部通过IRC验证。对于五个首次生成失败的体系,每个反应重新采样10次后,五个体系最终全部找到正确过渡态。
模型甚至能够处理铁卟啉参与的氢原子转移、Ru催化C–H活化以及包含二十面体硼烷结构的B–H活化等复杂体系,正确重建关键大环和团簇结构,并提供能够成功优化至真实过渡态的初始几何。

图4|UniTS-Gen的结构生成精度及分布外泛化能力。
从过渡态生成进一步走向选择性预测和反应机理发现
研究人员进一步检验UniTS-Gen是否能够解决真正的反应机理问题,而不仅仅是重现数据库中的三维结构。
第一个案例是Lewis碱稳定的硼基自由基与CH₃F发生C–F或C–H键活化。两个反应路径具有完全相同的反应物二维图,区别仅在于指定的反应位点。针对两个位点分别进行10次生成后,所有样本均按照条件产生预期的过渡态。随后经过DFT优化,两条路径均成功获得正确鞍点。计算得到C–H活化路径的自由能垒为36.0 kcal/mol,而C–F活化为40.5 kcal/mol,正确重现了C–H活化在动力学上更加有利的选择性。
第二个案例进一步考察立体化学空间。对于一个复杂的[3+2]偶极环加成反应,UniTS-Gen从相同反应物图和反应位点出发,成功采样全部四种可能的非对映过渡态TS6–TS9,而且所有生成结构经过DFT优化后都能够定位到相应的一阶鞍点。其中最低能垒构型TS6恰好对应实验文献报道的主要立体异构体。这说明生成模型不仅能够“找到一个过渡态”,还能够系统探索相互竞争的立体构型。
最后,研究人员挑战了更加复杂的ambimodal过渡态,即一个过渡态通过势能面分叉同时产生两种不同产物。该体系的元素组成完全没有出现在UniTS-Lib中。模型生成的10个候选结构中有7个形成预期过渡态几何,从中选择结构进行DFT优化后成功得到TS10。进一步从该结构开展准经典分子动力学模拟,可以同时观察到[4+1]和[2+1]环加成产物,与真实反应路径分叉行为一致。
这说明UniTS-Gen已经从单纯的结构生成工具进一步扩展为反应势能面探索的入口:通过改变反应位点、重复采样不同构象和构型,再结合DFT和动力学计算,可以系统寻找不同反应通道及其竞争关系。

图5|UniTS-Gen在反应选择性和复杂机理探索中的应用。
讨论
这项工作的核心价值在于将AI过渡态研究从相对理想化的小分子基准测试推进到更接近真实有机合成的复杂化学空间。过去,限制自动化过渡态发现的两个问题始终相互制约:一方面缺少具有足够元素和结构多样性的高质量数据,另一方面现有生成模型又难以从有限数据中学习过渡金属配合物、大型配体、自由基和离子体系所具有的复杂三维几何。研究人员通过UniTS-Lib与UniTS-Gen同时处理了数据和模型两个层面的问题。
UniTS-Lib的重要性不仅体现在4,391个结构的规模,更体现在其来源于真实有机合成机理研究,并经过统一量子化学水平重新优化和验证。42种元素、最高231个原子的结构以及大量过渡金属、离子和自由基体系,使其明显不同于主要由简单元素和小分子构成的传统基准数据。这种数据库也为后续通用化学三维生成模型提供了更接近实际应用的训练基础。
模型层面,UniTS-Gen最大的特点是将输入限制为二维反应物图和反应位点,而不是要求预先知道反应物与产物的精确三维结构。这一设计对于未知反应尤其重要,因为在真正的机理发现中,研究人员面对的问题往往正是“不知道最终会发生什么”。模型负责根据化学拓扑和反应中心探索可能的三维过渡态,而DFT负责进一步完成高精度优化和能量计算,由此形成“生成式AI提出初始结构—量子化学验证”的互补工作模式。
同时,这项工作强调了过渡态生成与普通分子构象生成之间的重要区别。过渡态势能面具有明显的多模态特征,相同二维反应图可能对应不同构象、不同立体构型甚至不同反应路径。因此,一个与参考结构RMSD较大的结果未必是错误结果,它可能只是另一个合理构型。研究人员引入碰撞率,并通过DFT优化、频率分析和IRC验证进一步评价结构,实际上提供了比单一RMSD更加符合化学意义的生成模型评估框架。
从实际应用角度看,Formula-OOS上68.7%的一阶鞍点收敛率以及41.9%的正确反应过渡态成功率尤其值得关注。 这意味着模型目前还不能取代量子化学过渡态优化,但已经可以承担过去最依赖人工经验的步骤——构建合理三维初始猜测。多次采样还能进一步提高成功概率,使过渡态搜索从“研究人员手工尝试不同结构”转变为“模型自动生成候选结构,再由量子化学筛选”。
当然,UniTS-Gen距离完全自动化反应机理发现仍有距离。当前模型需要用户预先指定反应位点,因此还不是从任意反应物出发自动发现所有可能反应路径的端到端系统;对于训练中完全没有出现的元素以及超过训练尺寸范围的大型体系,其性能也明显下降。研究人员提出,未来可以通过规则驱动的产物枚举或启发式方法自动识别候选反应中心,同时利用现有自动化数据流程不断扩展UniTS-Lib,从而逐渐改善Element-OOS和Maximum-OOS泛化能力。
更进一步,可靠的AI过渡态初始结构还可以与机器学习势能面结合,实现从候选结构生成到过渡态优化的端到端加速;生成的三维过渡态信息也可以进一步用于结构—选择性建模和数据驱动催化剂设计。 因此,这项研究并不是简单地用AI替代一次过渡态计算,而是在构建自动化反应机理研究的基础模块:从二维化学结构出发,由生成模型探索可能的三维过渡态,再通过量子化学和动力学计算完成验证、能垒比较和反应路径分析。这一框架有望显著降低复杂有机反应机理研究对人工试错和专家直觉的依赖,并推动计算化学逐步从“人工提出结构、计算验证”走向“AI生成假设、物理计算验证”的自动化机理发现模式。
整理 | DrugOne团队
参考资料
Xu, LC., An, J., Liu, W. et al. Automated transition state generation for mechanistic exploration in organic synthesis. Nat Commun (2026).
https://doi.org/10.1038/s41467-026-77230-8

内容为【DrugOne】公众号原创|转载请注明来源
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢