图片

 Chemistry World  是由英国皇家化学会出版的化学杂志,主要发布化学相关最新的新闻、观点、评论和科研进展。

为助您快速了解该杂志的最新讯息,我们特别开通了『今日 Chemistry World』栏目,欢迎扫描文末二维码访问 Chemistry World 官方网站。

  


科研新闻

一项针对 51 个基准配置的审计研究发现,许多广泛用于 AI 药物发现的基准数据存在问题,可能改变不同算法看起来孰优孰劣。训练集与测试集出现相同或高度相似的分子、同一分子被赋予矛盾标签等隐蔽缺陷,甚至可能改变排行榜上的领先模型。
对于开发药物发现机器学习模型的研究人员而言,基准数据相当于测试场。模型在基准上的表现,往往决定其在药物发现排行榜中的名次,以及它是否会被视为当前最先进的方法。
然而,基准数据集构成中的细微问题,也可能让某些模型看起来比实际情况更出色。例如,同一个分子或高度相似的分子同时出现在训练集和测试集中,这种现象被称为“训练—测试泄漏”。
对于基准数据集的担忧并非新问题。除了训练—测试泄漏,不同研究人员还曾注意到基准数据中存在标注不一致和结构解析错误。德国慕尼黑工业大学的 Maximilian Schuh 博士在参加一次机器学习会议后,看到研究人员高度依赖基准分数比较方法,开始思考这些问题究竟有多普遍。
Schuh 说:“人们一直怀疑某些基准测试并不理想。但你始终应该查看数据,而且需要把问题量化,才能证明数据确实存在缺陷。”
51个基准配置中,多数都发现了问题
Schuh 及其同事设计了一套审计框架,并将其用于 51 个基准配置。这些配置横跨四类使用最广泛的数据资源:7 个 Polaris 数据集、22 个 Therapeutics Data Commons (TDC) 数据集、9 个 MoleculeNet 数据集,以及 13 个药物—靶点相互作用 (DTI) 基准,其中包括源自 BindingDB 和 PDBbind 的数据集。这些资源合计获得了超过 1 万次引用。
研究人员在多数数据集中发现了问题,尤以训练—测试泄漏,以及完全相同的分子却被赋予矛盾标签最为突出。DTI 基准尤其容易出现重叠,其平均最近邻相似度得分为 0.779,而 Polaris 为 0.494。
缺陷不仅存在,还足以改变模型排名
为了检验这些问题是否真的会影响结果,团队有意把它们引入数据集,并用这些数据重新训练多种机器学习模型。结果显示,如果增加测试集中与训练样本完全相同或高度相似的分子,模型表现会得到提升;矛盾标签通常会降低模型表现。
在另一项实验中,研究人员使用替代测试集重新计算了基准排行榜。仅仅改变模型熟悉的化合物与矛盾标注在测试集中的构成,往往就足以改变最终排名第一的模型。
图片
  • 机器学习基准数据中可能隐藏着训练—测试污染、标签冲突和活性悬崖等多种缺陷
    Source: © Stephan Axel Sieber/Technical University of Munich

新加坡国立大学张阳教授从事 AI 驱动的治疗药物发现研究,其中包括数据库建设和基准设计。他说:“如果发生数据泄漏,训练集和测试集相似或存在重复,模型表现就会变得远好于实际情况。这是一个常见问题。这篇论文的价值在于,它跨越许多不同数据库和方法,对这个问题进行了定量检查。”
什么才算缺陷,还要看模型准备解决什么问题
英国帝国理工学院的 Pedro Ballester 教授评论说:“根本问题在于,许多基准没有与某个特定应用场景明确关联。”Ballester 的工作是开发并应用计算方法促进生物医学发现,其中包括虚拟筛选的基准测试。
他指出,在先导化合物优化过程中预测活性时,相似分子可能是合适的;但在虚拟筛选中,模型可能需要具备把结果推广到化学结构不同的化合物上的能力。
Schuh 及其同事目前呼吁研究人员报告测试集的具体组成,并对基准数据集开展常规审计。为此,他们创建了开源工具 BenchAudit,用于识别训练—测试污染和标签冲突等问题。
Schuh 表示,他们的目标并不是消除每一个缺陷,而是“提高认识,并尽可能保持诚实”。

References: M G Schuh, A Daniluk and S A Sieber, Chem. Sci., 2026, DOI: 10.1039/d6sc01799a

图片

扫描二维码

阅读原文



内容中包含的图片若涉及版权问题,请及时与我们联系删除