人工智能正逐步融入药物研发,推动分子性质预测、药效评价和安全性评估等任务的算法发展。然而,药物研发涉及多样的生物学过程、实验体系和数据类型,不同任务的预测目标与有效方法往往存在显著差异。从理解实验端点的生物学含义、界定预测任务,到设计和优化任务专用算法,仍需要大量领域知识与专家经验。随着研究任务和实验证据不断增加,如何使智能体理解这些差异,并据此持续开展研究与算法演化,成为药物研发智能化的重要课题。

为此,来自Valhalla Technology的研究团队提出ADMET-EvO,一种面向异质任务开展持续自主研究、驱动任务专用算法自主演化的科学智能体。系统融合领域知识与累积实验证据,将端点理解、任务定义、假设提出和实验验证贯通为研究闭环,持续改进算法并调整研究策略。以ADMET为验证场景,ADMET-EvO在覆盖22项任务的TDC ADMET基准比较中取得综合排名第一,并进一步通过解析实验端点,自主定义并建模43个毒性相关预测任务,展示了从领域理解、任务拓展到专用算法自主演化的持续研究能力。
从代码智能体到面向药物研发的持续自主研究
近年来,基于大语言模型(LLM)的代码生成与智能体系统快速发展,为算法研发的自动化提供了新的基础。AlphaCode展示了根据问题描述生成算法程序、求解竞赛编程问题的能力,Codex等代码智能体则进一步将代码编写、执行、测试和修复纳入连续工作流程。这些进展使智能体能够参与算法实现与迭代,也推动了一个更深入的问题:如何利用这种能力,自主发展适合具体科学任务的计算方法?围绕这一方向,AlphaEvolve等系统将大语言模型提出的程序改进与自动评价、演化搜索相结合,通过持续生成、检验和保留有效方案推进算法发现。DrugEvolve则将自主算法演化引入药物研发,利用研究员、工程师和分析师等角色协作,在多个研发阶段的任务中迭代改进已有算法。这些探索表明,领域内已经积累的算法与实验经验,可以成为智能体进一步发展任务专用方法的起点。
然而,在药物研发中持续推进算法研究,还需要处理任务背后的科学定义与证据差异。不同实验可能使用相近的端点名称,却对应不同的生物学过程、测量条件和标签含义;同一种方法也可能因数据覆盖、实验噪声或化学空间变化而表现不同。要据此开展有效的算法演化,智能体需要理解研究对象、判断数据是否适用,并将领域知识转化为可以通过实验检验的改进假设。任务定义、算法设计与实验评价因此需要紧密衔接。不仅如此,当研究进一步从单个任务扩展为一组持续变化的任务时,实验经验的积累与利用也成为关键。一次算法改进是否值得保留,需要检验其在独立数据上的有效性;一条路线反复失败后,后续研究需要据此调整;面对新的实验端点,系统还需要判断其能否形成明确的预测目标。由此,自主研究的演化对象延伸到任务定义、算法方案和研究策略,要求智能体将每轮实验的结果转化为后续研究的依据。
基于这一需求,ADMET-EvO将领域知识、任务专用算法演化与证据驱动的研究决策整合为持续的自主研究框架。系统从实验端点的理解与定义出发,诊断任务难点、提出假设并开展受控实验,再根据累积证据修正算法和后续行动,使已有任务的持续改进与新任务的自主拓展能够在同一框架中展开。研究选择具有多样生物学过程、实验体系和数据条件的ADMET作为验证场景,分别通过22项既定基准任务和43个自主定义的毒性相关任务,考察系统的任务专用算法演化能力与研究范围拓展能力。由此,ADMET-EvO探索的是以领域理解和实验证据为基础,持续推进一项研究计划的科学智能体架构。
ADMET-EvO构建由领域知识与实验证据驱动的自主研究架构
ADMET-EvO的核心架构围绕任务专用算法的自主演化展开。系统以ADMET Brain组织科研决策,将端点定义、认知画像、假设分支、多轴干预以及证伪与修正连接为连续的研究循环。每轮研究从当前任务的知识与证据状态出发,确定需要解决的问题、选择相应实验,并将结果用于更新算法方案与后续研究方向。
领域知识首先用于明确研究对象。面对一个实验端点,智能体需要理解测量目标、生物学背景、实验体系、物种及标签含义,并将这些信息整理为明确的任务定义。即使两个数据集具有相近的端点名称,其实验条件与读数含义也可能不同。ADMET-EvO因此在建模前确定测量边界,为后续的数据整合、算法选择和效果评价提供一致的依据。
在任务定义的基础上,系统进一步诊断影响预测的主要因素,包括样本与分子骨架覆盖、类别不平衡、标签冲突、化学空间偏移和验证稳定性等。论文中的任务诊断识别出DILI、HIA和半衰期任务的数据稀缺,以及部分CYP任务的类别不平衡等差异。智能体结合这些信息提出可证伪的解释,将任务难点转化为需要实验检验的算法改进方向。
任务专用算法通过数据、分子表征和预测模型三个方向的实验持续演化。系统可以调整训练数据的筛选与整合方式、选择适合端点的分子表征,或优化预测模型架构及其组合。每项行动都需要明确研究假设、匹配对照、预期效果与计算预算;实验固定其余因素,以判断所选干预是否带来可靠收益。这样的安排使算法演化能够围绕具体问题展开,并保留改进依据。
实验结束后,支持、否定、不确定及执行失败的结果都会进入证据账本,共同构成下一轮研究的起点。累积证据影响后续行动的优先级,系统据此继续探索、安排补充实验、保留当前算法、回滚到已获支持的方案,或停止投入。由此,算法配置的迭代与研究策略的更新相互衔接,使研究能够继承前序实验的经验。
这一闭环同时保留独立的评价约束。语言模型负责提出假设和选择允许的行动,数据处理、模型训练、指标计算、证据判定与状态更新由确定性组件完成。最终方案在接触测试集之前冻结,再进行多随机种子的独立评估。系统的自主性体现在决定下一步如何研究,其演化结果则由可重复的实验与独立证据检验。

图 1|ADMET-EvO核心架构。领域知识支持端点理解与任务定义,实验结果经证据评价后进入研究状态,持续驱动任务专用算法及研究策略的更新。
在22项TDC任务中验证任务专用算法的自主演化
研究首先在22项TDC ADMET基准任务中检验这一架构。任务覆盖药物吸收、分布、代谢、排泄和毒性的不同端点,包含分类与回归等预测形式。系统需要根据各任务的实验含义、数据特征及评价指标,分别形成并演化相应的预测算法。所有方案选择均在训练和验证阶段完成,最终配置冻结后再接受官方留出测试集的评价。
表 1|在 22 个 TDC ADMET 终点上的任务归一化性能。

在论文纳入、完整覆盖22项任务的前八种方法中,ADMET-EvO的任务归一化综合表现排名第一。与各任务TDC前五名模型的平均水平相比,系统在17项任务上取得更优结果。在TDC排行榜快照中,ADMET-EvO还在AMES、Half-Life Obach、Lipophilicity AstraZeneca、PPBR AZ和Solubility AqSolDB五个端点上取得估计第一的位置,结果覆盖不同的预测目标与指标体系。具体而言,Half-Life Obach的Spearman相关系数由上述比较基线的0.328提升至0.590;Caco-2 Wang与PPBR AZ的平均绝对误差分别降低27.1%和15.1%。这些结果表明,智能体能够针对差异明显的任务形成有竞争力的算法方案。最终方案的组成则进一步体现了这种任务适应性。Rich2D分子表征被18项任务采用,树模型出现在20项任务的最终方案中;与此同时,系统根据端点证据选择性地保留了MapLight+GNN、微调Uni-Mol2以及多模型融合等配置。例如,MapLight+GNN被用于生物利用度和CYP2C9底物任务,微调Uni-Mol2则用于亲脂性及部分融合方案。不同任务形成了不同的表征与模型组合,体现出算法演化对具体研究条件的响应。
在计算效率方面,基于证据的计算感知方案选择使20/22项任务满足预设非劣效标准,所选方案的累计拟合时间从2.25小时降至0.62小时,减少72.2%。这一结果反映了最终方案拟合成本的下降,说明积累的实验信息也能帮助智能体在性能要求下选择更经济的算法。

图 2|22项TDC ADMET任务的基准表现、榜单快照结果、计算成本与预测适用性分析。
为进一步检验算法改进的来源,研究分别对数据、分子表征和模型三个方向开展消融实验。按论文的汇总正向归一化增益口径,表征、模型和数据方向分别贡献55.0%、25.2%和19.9%,显示三类研究行动具有互补作用。其中,表征干预在独立验证集上改善了21项任务,18项在官方留出测试中仍保持正向效果;模型干预在独立验证集上改善了16项任务,13项在官方留出测试中保持正向效果。数据方向的实验则提供了领域匹配与独立验证相结合的实例。在hERG任务中,系统完成外部数据筛选、排除与留出分子接近的候选类似物后,数据扩充使留出AUROC从0.7319提高至0.8346。这些结果表明,科学智能体能够将领域知识与实验证据转化为任务专用算法的持续改进,为药物研发从专家主导的逐项算法优化走向证据驱动的自主演化提供了实践基础。

图 3|数据、分子表征和模型三条干预轴在不同ADMET任务上的贡献。
从实验端点出发自主探索43个毒性相关任务
22项基准实验检验了ADMET-EvO在既定任务上的算法演化能力。研究随后将系统应用于更广泛的毒性端点空间,进一步考察其能否理解新的实验信息、自主定义预测任务,并将已有研究机制延伸至初始基准之外。
这一阶段首先需要解决任务本身的定义问题。候选端点包含分子读数、细胞响应、整体生物表型及实验控制等不同类型。ADMET-EvO结合测量内容、响应方向、生物学证据层级、实验背景、来源与化合物标签,判断端点能否形成明确的预测目标。生物学解释或响应方向存在不确定性的读数,需要保留相应限定;荧光及报告系统干扰则需要与毒性相关响应区分处理。
通过这一过程,系统自主选择、定义并建模了43个未知的毒性相关预测任务。其中,35个具有可解释的生物学含义,覆盖内分泌干扰、应激反应、细胞毒性、细胞功能障碍、免疫失调、血管功能障碍、组织重塑和发育毒性八类过程;另外8个被单独归为实验有效性或报告系统控制任务。这一分类保留了不同实验能够支持的解释边界。例如,内分泌相关端点区分了受体组装、共调节因子招募、受体拮抗及转录响应;细胞层面的读数则涉及细胞活力、线粒体膜电位及细胞骨架变化等不同过程。系统据此形成各自明确的任务定义,使算法研究建立在对实验含义的理解之上。
任务定义完成后,ADMET-EvO继续为各端点选择分子表征、模型组合及集成权重,形成23种不同的双流水线集成配置。在论文报告的43个保留任务中,集成模型的留出MCC点估计均高于针对各端点回顾性选出的六种固定单模型中的最佳者,平均MCC从0.289提高至0.310。在35个生物学可解释任务中,平均MCC为0.313,其中27个达到MCC≥0.20,21个达到MCC≥0.30。不同端点的改进也对应不同的算法方案。ERα–ERE报告活性任务通过结合Morgan与多视图二维表征的ExtraTrees–Random Forest集成获得0.103的MCC提升;线粒体膜电位扰动任务则通过多视图ExtraTrees–XGBoost集成获得0.072的提升。这些实例进一步展示了智能体依据任务特征形成专用算法的能力。

图 4|43个毒性相关任务的分布,定义与结果。
从一次性工作流,走向会继承经验的科研程序
ADMET-EvO的价值在于探索了以持续自主研究推动任务专用算法演化的AI for Science新路径。系统将端点定义、实验结果、证据状态与后续决策纳入统一的研究过程,使成功与失败都能够成为算法改进和策略调整的依据。由此,智能体的演化延伸至研究问题的界定、实验方法的选择与研究范围的拓展,为药物研发中能够积累经验、持续推进的自主科研系统提供了实践基础。
作为自主科学智能体的早期探索,ADMET-EvO仍需面对数据稀缺、标签噪声和分布偏移等挑战,其计算结果也有待真实实验的进一步检验。它所展示的方向,是将智能体的自主性建立在领域理解、受控实验、独立验证与持续积累的证据之上。随着新数据、实验读数与科学问题不断纳入研究,这一框架有望推动ADMET研究形成能够长期积累知识、自主演化算法并拓展研究任务的开放研究体系,也为更广泛科学领域中的持续自主研究提供参考。
参考资料
论文题目:ADMET-EvO: a self-evolving scientific agent for sustained research across heterogeneous tasks
通讯作者:Jiaqi Wang、Yuzhi Xu、Tingjun Hou、Odin Zhang
研究单位:Valhalla Technology;The Chinese University of Hong Kong;Zhejiang University;Stanford University
代码:https://github.com/OTeam-AI4S/ADMET-EvO
https://arxiv.org/abs/2609.10121
内容中包含的图片若涉及版权问题,请及时与我们联系删除



评论
沙发等你来抢