DRUGONE

准确描述化学键形成与断裂是量子化学中的核心问题,但也是最具挑战性的任务之一。当分子接近解离状态时,电子结构往往从弱相关转变为强相关或多参考特征,传统单参考方法可能失效,而多参考量子化学方法虽然更加可靠,却通常具有很高的计算成本,并且每研究一个新体系都需要重新进行昂贵计算。研究人员提出了一种名为 Orbformer 的可迁移神经网络波函数基础模型,试图改变这种“每个分子从头计算”的传统模式。Orbformer基于深度量子蒙特卡洛(deep QMC),首先在超过2.2万个平衡及非平衡分子结构上进行预训练,使模型学习不同分子之间可重复利用的电子结构规律,随后通过可迁移微调获得新体系的高精度波函数。


在Diels–Alder反应、多个化学键解离曲线以及TinyMol等基准上,Orbformer表现出优异的精度—计算成本平衡。在具有明显多参考特征的化学键断裂问题中,该模型能够随计算量增加稳定、系统地收敛至约1 kcal/mol的“化学精度”,并在多个体系中处于或超过传统量子化学方法形成的Pareto前沿。联合微调本身可带来约20倍效率提升,而化学预训练还能进一步降低达到目标精度所需的计算量。更重要的是,Orbformer并非单纯记忆训练数据,而是在没有显式监督的情况下学习出局域化核心轨道、轨道复用和局域电子结构等具有明确物理意义的特征。研究表明,将求解薛定谔方程的计算成本分摊到大量分子之间,有望使高精度多参考电子结构计算从逐体系求解转变为可迁移、可复用的基础模型范式。

从第一性原理预测分子和材料性质的主要障碍之一,是高精度电子结构计算所需的巨大计算成本。显式描述多体电子波函数的方法原则上能够达到很高精度,但随着体系规模增加,计算代价迅速上升。对于接近平衡构型的许多普通分子,电子结构通常以弱相关为主,耦合簇等单参考方法可以获得很高精度;然而,一旦涉及化学键拉伸和断裂、过渡态以及其他强电子关联过程,单一电子构型便不足以描述真实波函数,需要采用多参考方法。


问题在于,目前并不存在适用于所有强相关体系的统一高效波函数方法。多参考计算不仅更加昂贵,而且往往需要针对具体体系选择活性空间、基组以及其他计算参数。因此,即使两个分子包含非常相似的官能团和局部化学环境,传统从头算方法通常仍需要分别求解。换言之,化学家长期利用“相似结构具有相似电子性质”的规律理解化学,但高精度从头算计算却很少真正复用此前已经完成的计算。


研究人员由此提出一种不同的思路:从头算并不意味着每一次计算都必须真正从零开始。 一个方法仍然可以完全依据第一性原理求解薛定谔方程,同时利用其他分子中已经学习到的电子结构规律加速新体系求解,只要这种知识迁移影响的是收敛速度,而不是最终物理解。深度QMC特别适合这一思路,因为它使用神经网络直接表示波函数,并通过变分能量最小化获得基态,因此神经网络参数可以跨分子共享。


此前已经出现利用参数共享或者数百个分子预训练波函数模型的尝试,但规模、化学多样性和泛化能力仍然有限。研究人员因此将“基础模型”引入波函数计算:这里的基础模型并非无需进一步训练即可解决所有任务的通用AI,而是一个首先在广泛化学空间中学习电子结构规律、随后针对新体系继续微调的统一波函数模型。



方法

研究人员开发了可跨不同分子组成、尺寸和几何构象使用的Orbformer波函数模型。其核心包括负责处理电子特征及电子间相互作用的 Electron Transformer,以及根据原子核组成和几何环境动态产生广义轨道的 Orbital Generator。模型特别强调局域性和可组合性,使距离较远粒子之间的相互作用逐渐衰减,并鼓励相似局部化学环境共享相似轨道表示。Orbformer通过变分蒙特卡洛直接最小化体系能量,因此不需要外部高精度能量标签。研究人员建立Light Atom Curriculum(LAC)预训练数据集,包括22,350个不同几何构型,涵盖H、Li、B、C、N、O和F等元素以及大量偏离平衡状态、具有多参考特征的构型,并采用逐步增加体系规模和复杂度的方式进行预训练。预训练最大体系含24个电子,而微调阶段可扩展至106个电子。针对新任务时,不再为每个几何构型独立优化模型,而是将同一反应路径或相关结构联合微调,使预训练知识与跨构象参数共享共同降低计算成本。



结果

Orbformer建立可迁移的量子化学波函数基础模型

Orbformer与传统单分子神经网络波函数最关键的区别,是将分子本身作为波函数网络的输入。因此,同一组网络参数能够描述组成、尺寸和几何结构不同的多个分子,而不是针对每一个分子重新建立一个独立模型。


Electron Transformer通过注意力机制处理电子表示,而Orbital Generator根据具体分子环境动态生成轨道。模型同时加入局域性约束,使相距较远的粒子相互作用逐渐减弱。这样,当不同分子中出现相似局部环境时,模型便可以重复利用已经学习的轨道和电子结构模式。


这种设计使“预训练波函数”成为可能。LAC数据集不仅包含接近平衡态的小分子,还刻意加入弯曲、拉伸和解离等非平衡构象,使模型在预训练阶段就接触化学反应中最困难的多参考电子结构。预训练得到的模型首先掌握广泛化学空间的半定量电子结构,再针对具体反应或新分子进行高精度微调。


更重要的是,研究人员采用联合微调而非逐结构独立微调。例如,一条反应路径上的多个几何构型能够使用同一组模型参数共同优化,从而进一步把计算成本分摊到整个势能面。

图1|Orbformer波函数基础模型的架构、LAC化学预训练以及面向新化学过程的可迁移联合微调流程。


Orbformer准确描述Diels–Alder反应路径

研究人员首先选择经典的Diels–Alder反应检验Orbformer。乙烯与丁二烯的环加成可能通过两种主要路径发生:一种是两个新化学键同步形成的协同机制,另一种是经过双自由基中间体、两个化学键依次形成的两步机制。准确区分二者需要同时处理静态和动态电子相关,因此是具有代表性的高精度电子结构测试。


对于协同反应路径,Orbformer计算得到的活化能几乎收敛到实验值。值得注意的是,该过渡态包含46个电子,并涉及两个化学键同时发生显著变化,明显超出了最大仅含24个电子的预训练体系,但预训练仍显著提高了模型的收敛速度。传统波函数方法中,只有多参考耦合簇方法能够达到类似实验精度,而且其结果还依赖较小基组或者受到人为限制的构型空间。


对于经过双自由基中间体的两步机制,Orbformer预测的活化能比实验活化能高约9.9 kcal/mol,明确表明该路径并非优势机制,与目前理论和实验认识一致。对于整个反应的反应能,Orbformer同样能够收敛到距离实验值1 kcal/mol以内。


这一实验说明,Orbformer不仅能够处理训练分布中的普通分子,还能够迁移至尺寸更大、电子结构更复杂的真实化学反应过渡态。

图2|Orbformer与传统量子化学方法预测Diels–Alder反应活化能和反应能的精度比较。


化学键断裂中实现更优的精度—成本平衡

随后,研究人员将重点转向论文的核心问题——化学键断裂。研究选择五种分子的解离过程,在每条最低能量路径上设置20个结构点,体系规模最高达到48个电子。由于化学键逐渐拉伸时会经过强相关程度显著变化的区域,因此这一基准能够直接考察方法是否真正具有稳定处理多参考电子结构的能力。


研究人员将Orbformer与CCSD(T)、NEVPT2、MRCISD、MRAQCC以及多种DFT方法进行比较。结果显示,经过LAC预训练并联合微调的Orbformer,在所有测试体系中均位于或超过传统方法形成的精度—成本Pareto前沿。尤其重要的是,Orbformer随着投入计算量增加表现出严格而稳定的误差下降趋势,可以系统地逐渐逼近高精度结果。相比之下,一些传统多参考方法即使增加计算成本,也不一定能够实现同样稳定的系统收敛。


联合微调本身即可产生约20倍效率提升,意味着一条包含20个结构点的解离曲线几乎可以实现完整的计算成本分摊。在此基础上加入LAC预训练,效率进一步提高。例如,对预训练数据中已经覆盖的乙烷,达到化学精度所需成本下降约16倍;对尺寸更大的1-丙醇下降约6倍。对于远大于预训练体系的L-丙氨酸,预训练在较低精度阶段仍带来明显加速,但随着长时间微调,预训练优势逐渐缩小。


因此,预训练并不能消除针对新体系的高精度优化,但可以显著缩短“从初始波函数到化学精度”的距离。

图3|五种分子化学键解离最低能量路径上的Orbformer精度、相对能量误差以及与传统量子化学方法的精度—计算成本比较。


预训练显著提升跨分子泛化和收敛速度

为了进一步区分模型架构和预训练本身带来的贡献,研究人员在TinyMol数据集上将Orbformer与此前的可迁移deep QMC方法以及单点Psiformer进行了比较。TinyMol相对简单,强相关效应较弱,并提供高精度CCSD(T)参考能量,同时包含分布内结构和预训练中未出现过的分布外分子。


结果显示,无论采用LAC还是TinyMol数据进行预训练,Orbformer在分布内和分布外测试集上均表现出最佳综合性能。与完全从头训练相比,预训练Orbformer达到化学精度所需的计算量至少降低一个数量级。Psiformer虽然最终能够达到较高精度,但由于每个结构独立优化,计算成本明显更高。


研究还揭示了一个重要规律:预训练数据的相关性比单纯的数据规模更加重要。 在TinyMol测试中,使用较小但分布高度匹配的TinyMol数据预训练,比使用更大LAC数据集效果更好。相反,当研究人员测试LiCN化学键拉伸时,由于LiCN相关化学组成存在于LAC而不存在于TinyMol,完整LAC预训练成为效果最好的初始化模型。


这说明基础模型的迁移效率与目标体系距离预训练化学空间的远近直接相关,也意味着未来扩大预训练数据的元素、官能团、电子态和非平衡构象覆盖范围,有望进一步扩大Orbformer可以快速求解的化学空间。

图4|Orbformer在TinyMol分布内、分布外以及LiCN化学键拉伸任务中的预训练与微调收敛性能。


Orbformer自主学习可复用的电子结构规律

研究人员进一步分析Orbformer究竟学习到了什么。他们在含6–13个碳原子的烷烃系列上进行统一微调,并检查模型生成的轨道。


一个非常有意思的现象是:在没有任何轨道类型监督的情况下,Orbformer会为每个碳原子自动形成两个高度局域化的轨道,表现得类似传统量子化学中的核心电子轨道。这种规律在大约1万步预训练后便已经开始出现。相比之下,从头训练的模型虽然也会产生一定局域化,但明显弱于经过LAC预训练的模型。


更直接的证据来自辛烷和庚烷比较。当两个分子中的电子位于具有相似局部化学环境的位置时,相应Slater矩阵部分几乎完全一致;只有局部环境真正发生变化的位置才出现明显差异。这意味着Orbformer确实会在不同分子之间复用电子轨道表示,而不是简单记忆完整分子的波函数。


进一步分析显示,Orbformer波函数总体呈明显局域性:改变一个电子的位置时,影响最大的是其附近电子和轨道,但模型仍保留少量必要的长程相互作用。这种“局域复用+选择性长程关联”的结构解释了为什么同一个模型能够跨分子组合已经学习的电子结构规律。

图5|Orbformer自主学习局域核心轨道、跨分子轨道复用以及电子结构局域性和可组合性的内部机制。



讨论

这项工作的核心突破并不只是提出了一个精度更高的神经网络波函数模型,而是尝试改变高精度从头算量子化学的计算范式。传统量子化学通常把每个分子视为一个新的独立问题,即使此前已经计算过大量具有相似局部结构的分子,求解新体系时仍然需要重新付出大部分计算成本。Orbformer则提出另一种思路:薛定谔方程仍然针对每个新体系严格求解,但求解过程不必从零开始。


这种区别也决定了Orbformer与普通机器学习势能模型不同。它并不是训练一个网络直接拟合已有高精度能量标签,而是使用神经网络表示真正的多电子波函数,并继续依据变分原理优化。因此,预训练主要改变的是求解薛定谔方程的起点和收敛速度,而不是用经验数据替代第一性原理计算。这也是研究人员将其称为“从头算基础模型”的关键原因。


研究最有说服力的部分来自化学键断裂。随着键长增加,体系可能从单参考区域进入强多参考区域,使很多常规电子结构方法面临困难。Orbformer不仅能够在这些区域获得较高精度,而且计算误差会随着微调持续稳定下降。这种可系统改进性十分重要,因为实际量子化学研究不仅关心最终误差,也需要知道投入更多计算资源能否可靠获得更准确的答案。


另一方面,结果也表明预训练并非万能。目标体系越接近预训练化学空间,迁移收益越明显;当体系规模、元素组成或电子结构与预训练数据差异很大时,预训练优势会减弱,并需要更长时间的体系特异性微调。因此,Orbformer目前还不是一个可以“零样本”解决任意量子化学问题的通用模型。研究人员所定义的基础模型,本质上仍是预训练后针对新体系继续求解和优化的可迁移波函数模型。


值得注意的是,模型内部分析提供了基础模型能够迁移的物理解释。Orbformer自动学习出类似核心轨道的局域结构,并能够在具有相似局部环境的不同分子之间重复利用这些轨道。也就是说,模型似乎自主发现了化学长期以来最基本的规律之一:复杂分子的电子结构并非完全独立,而是由大量可以在不同分子中反复出现和组合的局部电子结构模式构成。这种规律并未通过传统轨道概念显式写入网络,而是在跨分子变分训练过程中自然出现。


从应用角度看,研究人员认为Orbformer未来未必需要直接承担所有大规模模拟任务。更现实的路径可能是利用其生成大量高质量、多参考电子结构数据,再训练成本更低的反应型力场或其他近似模型。这样,高精度deep QMC可以作为连接第一性原理电子结构与大尺度分子模拟之间的数据生成层。


总体而言,这项研究将“基础模型”的思想从分子性质预测进一步推进到了多体波函数本身。Orbformer证明,不同分子的高精度量子力学计算并不一定是彼此孤立的问题:通过大规模化学预训练、局域可组合波函数表示以及跨构象联合微调,可以把过去求解薛定谔方程积累的计算经验迁移到新的分子和化学过程。对于化学键断裂、过渡态以及其他传统多参考方法昂贵且难以系统收敛的问题,这种“学习如何更快地求解薛定谔方程”的路线,可能成为AI与第一性原理量子化学结合的重要方向。

整理 | DrugOne团队


参考资料


Foster, A., Schätzle, Z., Szabó, P.B. et al. An ab initio foundation model of wavefunctions that accurately describes chemical bond breaking. Nat Commun (2026). 

https://doi.org/10.1038/s41467-026-76604-2

内容为【DrugOne】公众号原创转载请注明来源

内容中包含的图片若涉及版权问题,请及时与我们联系删除