DRUGONE
Buchwald–Hartwig(BH)交叉偶联是现代合成化学,尤其是药物研发中构建芳基–氮键的重要反应。然而,机器学习对该类反应进行预测时仍面临一个核心问题:模型通常能够较好预测训练数据覆盖的化学空间,却难以可靠处理训练过程中从未出现的新底物和新反应条件。电子实验记录中的数据往往存在来源异质、噪声较大、实验条件不统一以及产率记录方式不同等问题,而公开的高通量实验数据虽然质量较高,却通常规模有限且化学空间覆盖狭窄,这些因素共同限制了模型的分布外泛化能力。
研究人员建立了一套以高质量数据、多源数据标准化、高通量实验(HTE)和主动学习为核心的BH反应预测框架。研究首先通过自动化实验产生11,300条高质量BH反应数据,并整合已有公开HTE数据,形成约27,500条反应的统一数据集。主动学习进一步在约6,400万条虚拟BH反应构成的空间中优先选择高不确定性和高多样性样本开展实验,从而有针对性地扩大训练数据的化学空间。
研究发现,决定分布外预测能力的关键并非单纯的数据量,而是底物和反应条件的多样性。为此,研究人员提出化合物–反应多样性评分(Compound-Reaction Diversity Score,CRDS),用于衡量数据集支持分布外预测的潜力。CRDS与最严格分布外测试中的ROC AUC呈0.79的Pearson相关,而单纯数据集规模对应的相关性仅为0.60。更值得注意的是,在经过合理数据整理和特征表示后,相对简单的随机森林模型在高置信度分布外预测中即可获得超过90%的ROC AUC。
最终,研究人员通过真实实验验证模型价值。对于11组历史上反应失败的底物组合,模型仅推荐并实验测试44个反应条件,就为其中10组找到可行条件;面对由约2.46×10^11种潜在反应构成的巨大未知空间,高置信度模型推荐反应的成功率达到33%,明显高于约19%的基线水平。研究由此说明,高质量、高多样性数据与主动学习的结合,可以比单纯增加数据量或提高模型复杂度更有效地实现化学反应的稳健分布外预测。

Buchwald–Hartwig偶联已经成为现代有机合成的重要工具,尤其适用于构建结构多样的芳基胺和杂芳基胺。在药物发现过程中,大量候选化合物都需要形成C–N键,因此如果能够提前判断某一底物组合能否发生反应,并进一步推荐合适的催化剂、碱和溶剂,就能够显著减少条件筛选实验,提高设计–合成–测试循环的效率。
机器学习为这一问题提供了新的解决途径,但真正具有实际价值的模型必须能够处理“没有见过的化学”。传统随机划分测试集通常与训练集具有较高化学相似性,因此得到的高准确率并不能保证模型在新底物、新骨架或新反应条件下依然可靠。药物化学实际应用恰恰需要这种分布外预测能力。
另一个关键限制来自数据。电子实验记录和文献数据规模庞大,但不同实验之间的反应设置、纯化方式和产率报告标准差异明显,同一种化合物甚至可能具有不同表示形式,而且文献往往缺乏失败反应。相比之下,HTE可以利用标准化自动流程系统地改变底物、催化剂、碱和溶剂,在相同实验条件下快速产生大量成功和失败反应,因此特别适合建立反应预测模型。
研究人员因此提出,与其单纯收集更多反应,不如通过主动学习决定“下一批最值得做什么实验”,让实验数据主动填补模型知识空间中的空白。整个研究的核心目标,就是通过多源HTE数据整合、主动学习和严格分布外评价,建立能够在有意义的BH反应空间内可靠泛化的预测模型。
方法
研究人员采用96孔和384孔自动化平台开展BH高通量实验,通过系统改变芳基卤化物、胺、钯催化剂、碱和溶剂构建反应数据,并使用UPLC-MS-CAD进行产物定量。数据生成分为三个迭代阶段:第一阶段建立基础反应空间并提高催化剂、碱和溶剂组合的多样性;第二和第三阶段引入模型指导实验设计,根据模型不确定性优先选择能够扩大底物化学空间的反应。最终产生11,300条高质量内部HTE数据,同时整理并标准化已有公开BH HTE数据,形成约27,500条反应的统一数据集。考虑到不同来源采用CAD、分离产率等不同定量方法,研究人员以10%产率作为统一成功/失败阈值,将问题转化为二分类预测。主动学习阶段在约6,400万条虚拟BH反应中结合模型不确定性、结构相似性、空间密度和多样性选择新实验。模型评价则使用DRFP反应指纹和理化性质等不同表示训练多类机器学习模型,并通过聚类建立严格的分布外测试集,确保测试底物没有出现在训练数据中,同时综合ROC AUC、平衡准确率、F1和AUPRC等指标评价性能。

图1|面向稳健分布外预测的Buchwald–Hartwig反应机器学习总体框架。
结果
自动化高通量实验和主动学习持续扩展反应化学空间
研究人员首先建立自动化数据生产体系。与单纯从已有实验记录中收集数据不同,该体系能够根据模型需要主动决定下一轮应该测试哪些反应。
第一轮实验主要用于确定关键变量并扩大催化剂、碱和溶剂的组合范围,从而建立基础预测模型。第二轮和第三轮则转向模型驱动的数据收集:模型首先预测更大的虚拟反应空间,再根据预测不确定性寻找当前模型最缺乏知识的区域,将这些反应送入自动化平台进行实验,并用新数据重新训练模型。
随着三个阶段推进,反应数量持续增加,同时模型的平衡准确率也不断提高。最终获得11,300条高质量反应,成为研究后续分布外建模的重要数据基础。论文第3页图2清楚展示了这种“实验设计—自动执行—模型更新”的循环,以及数据量和预测性能随主动学习迭代同步提升的趋势。
这种策略的重要意义在于,新增实验并非随机增加数据量,而是针对模型知识边界进行扩充。换言之,每一轮实验都在尽可能补充此前数据覆盖不足的化学区域,从而使有限实验资源产生更高的信息增益。

图2|自动化高通量实验与主动学习驱动的模型构建。
数据多样性比单纯扩大数据集更能决定分布外泛化能力
对不同数据源进行系统比较后,研究人员得到一个重要结论:数据集规模并不是决定OOD性能的主要因素。
不同BH数据集在两个维度上存在明显差异,即包含多少种不同底物组合,以及覆盖多少种不同试剂条件。有的数据集规模较大,却集中在有限的反应条件或底物区域;另一些数据虽然规模并非最大,却覆盖更加多样的底物–试剂组合,因此训练出的模型反而具有更好的分布外表现。
为了定量描述这一现象,研究人员提出CRDS。该指标综合考虑独特反应物组合、独特试剂组合以及数据集规模,并通过边际收益递减设计避免简单追求数量。结果显示,在最严格的OOD评价中,CRDS与ROC AUC之间的Pearson相关系数达到0.79,而数据集规模本身只有0.60。
论文第4页图3进一步显示,将研究中新产生的JnJ25数据加入所有公开BH HTE数据之后,模型在ROC AUC、AUPRC、平衡准确率和F1等指标上整体改善。严格测试还排除了训练阶段已经出现过的芳基卤化物或胺,使这种性能提升更能代表真正的化学空间外推能力。
这一发现将反应机器学习的数据构建逻辑从“更多数据”转向“更有信息量的数据”。对于有限实验预算而言,设计能够最大程度增加底物和条件覆盖度的实验,可能比随机产生大量高度重复的数据更有价值。

图3|不同数据源的化学多样性及其对分布外预测性能的影响。
高质量数据和合理特征表示使简单模型也能实现可靠OOD预测
研究人员随后分析了一个实际应用中非常重要的问题:是否必须使用复杂深度学习模型,才能实现高水平化学反应预测?
结果并非如此。在经过标准化整理的约27,500条反应数据上,相对简单的随机森林模型已经表现出很强的OOD能力。尤其是在模型自身判断为高置信度的分布外反应中,随机森林的ROC AUC超过90%。
进一步比较随机森林、梯度提升模型和多层感知机后,研究人员发现,特征表示方式对OOD性能的影响甚至大于几种表现最佳的模型架构之间的差异。当底物结构信息与试剂理化性质被合理分离和编码后,简单模型就能够充分利用这些化学信息。
这一结果进一步强化了研究的数据中心思想:反应预测性能并不必然随着模型复杂度提高而增加。如果数据存在偏差、化学空间狭窄或者表示方式不能反映关键化学信息,那么更加复杂的神经网络同样可能学习到训练集中的偶然关联。
与此同时,模型置信度具有实际筛选价值。随着预测置信度提高,OOD预测的ROC AUC和平衡准确率同步提高。因此可以根据置信度对大量候选反应排序,只将最有希望的反应送入实验室验证。

图4|分布外预测的模型不确定性校准与置信度分层性能。
模型成功挽救历史失败反应并发现未知化学空间中的可行反应
真正决定模型是否具有实际价值的,是其能否指导新的实验。因此,研究人员设计了两组前瞻性验证。
第一项实验针对11组历史上曾经失败的芳基卤化物–胺组合。其中部分底物组合此前已经测试多达24种反应条件,却始终没有获得成功结果。研究人员从数据覆盖充分的催化剂、碱和溶剂中构建1,092种候选条件,并让模型按照预测置信度排序。
对于每一组底物,只实验验证模型排名最高的4个条件,因此总计仅需要开展44次反应。最终27次反应获得超过10%的产率,并成功为11组历史失败底物中的10组找到可行合成条件,即91%的底物组合得到“挽救”。
第二项实验更加严格。研究人员构建包含13种催化剂、12种碱、7种溶剂、12,252种芳基卤化物和18,364种胺的巨大虚拟空间,总计约包含2.46×10^11种潜在BH反应,并特意选择训练数据从未出现过的芳基–胺组合。
未经模型富集的4,800个基线反应成功率约为19%;模型中等置信度推荐的反应成功率达到21%,约为基线的1.11倍;而预测置信度高于0.85的反应成功率达到33%,相对于基线实现1.64倍富集。
因此,模型最重要的能力并不是声称能够准确预测整个巨大化学空间,而是能够判断“哪些未知区域值得相信”。对于高置信度预测,实验成功概率得到显著富集;而对于模型缺乏知识的区域,则可以利用不确定性主动标记出来,避免盲目依赖预测。

图5|模型推荐Buchwald–Hartwig反应条件的前瞻性实验验证。
讨论
该研究围绕一个长期困扰化学机器学习的问题给出了较为明确的答案:要实现真正有用的分布外反应预测,仅仅扩大训练集或构建更加复杂的神经网络并不足够,训练数据是否覆盖足够多样的化学空间可能更加重要。
研究人员通过BH偶联系统证明,数据多样性、标准化HTE和主动学习可以形成互相促进的闭环。HTE提供一致且包含失败结果的高质量数据;机器学习模型识别当前数据空间中的不确定区域;主动学习选择最值得开展的新实验;新实验再补充模型此前缺失的化学知识。与一次性建立静态数据库相比,这种模式实际上将反应数据集变成一个能够随模型需求持续发展的动态资源。
CRDS的提出进一步体现了这种数据中心思想。过去评价化学机器学习数据集时经常首先关注反应数量,而本研究表明,具有大量高度相似反应的数据集未必适合训练OOD模型。底物组合和试剂条件的有效覆盖程度可能更加重要。因此,未来建立反应数据库时,可以在实验之前利用类似CRDS的指标评估计划中的数据是否真正增加了化学空间,而不是等实验全部完成后才发现大量数据彼此冗余。
另一个重要结论是模型复杂度并非唯一决定因素。在合理整理的数据和适当特征表示下,随机森林即可在高置信度OOD反应上获得超过90%的ROC AUC。这并不意味着深度学习或预训练Transformer没有价值,而是说明对于当前约27,500条数据、单一BH反应类型的任务,数据质量和化学表示带来的收益可能超过进一步增加模型复杂度。研究人员认为,当未来扩展到更多反应类型和更大的化学空间时,预训练模型的优势可能逐渐显现。
研究仍然存在明确边界。当前模型虽然能够外推到新的底物组合,但所使用的试剂空间仍主要位于训练过程中覆盖的32种钯预催化剂、12种碱和12种溶剂范围内,因此不能将结果理解为能够可靠预测完全未知类别的催化剂或试剂。与此同时,为整合不同来源的数据,研究采用10%产率作为成功与失败的二分类阈值,这非常适合药物化学中的go/no-go决策,却损失了连续产率信息。CRDS虽然在BH反应中表现出较强相关性,其参数也是针对这一反应类型经验确定的,推广至其他反应仍需要重新校准。
未来更大的挑战是将这一框架从单一BH偶联扩展至多种合成反应,并进一步处理工业电子实验记录中大量非结构化、异质和噪声数据。如果能够将高质量HTE、历史实验记录、化学知识模型以及自动化实验平台进一步整合,机器学习就可能从单纯的“反应结果预测器”转变为真正参与实验决策的合成规划系统。
总体而言,这项研究最重要的启示并不是提出了一个更复杂的BH反应预测算法,而是建立了一套数据标准化—主动学习—自动化HTE—严格OOD评价—不确定性排序—前瞻性实验验证的完整工作流。它证明,在合成化学机器学习中,与其单纯追求“更大的模型”和“更多的数据”,更值得关注的是如何获得覆盖更广、信息密度更高并能够针对模型知识盲区持续扩展的数据。这种数据中心的策略为未来建立真正能够处理新底物和新化学空间的反应预测模型提供了可推广的技术路径。
整理 | DrugOne团队
参考资料
Neves, P., Hao, B., Aikonen, S. et al. Robust out-of-distribution prediction of Buchwald–Hartwig reactions. Nat Comput Sci (2026).
https://doi.org/10.1038/s43588-026-01017-6

内容为【DrugOne】公众号原创|转载请注明来源
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢