I think it will change science," AI just did in 2 days what researchers  took 10 years to find - Futura-Sciences

基础模型的最新进展使人工智能科学家能够自动化日益完整的科研工作流程,涵盖从假设生成、代码执行到论文撰写的各个环节。然而,仅靠工作流程覆盖并不能获取科学发现所依赖的全部证据。现有系统通常基于文本、代码、标签或预先计算的摘要进行推理,而忽略了对科学至关重要的空间、时间、跨渠道和程序关系。我们推出了 OmniScientist,一个端到端、全模态的人工智能科学家,能够直接从异构原始证据中开展多学科研究。感知层和三个分别负责构思、实验和撰写论文的自主代理在一个确定性流程中运行,使得观察结果能够贯穿整个研究生命周期,影响研究问题、实验决策和最终结论的形成。通过在代码中运行想法、严谨性和结论检查,该系统能够确保创新性筛选、统计有效性、执行来源和数值可追溯性。我们使用涵盖 5 个学科领域、4 种科学证据类型以及图像、信号、音频、视频、三维结构、轨迹、表格、公式和图表等多种模态的 36 个真实数据案例对 OmniScientist 进行了评估。在所有 36 个案例中,该系统均完成了从原始数据到最终论文的完整路径,并借助参考推理框架实现了 6.3 的平均论文总分。在与仅接收预计算标量特征的盲测版本进行的配对比较中,直接感知在所有 7 个评估维度上均有所提升,并在 85% 的直接比较中胜出。这些结果表明,全生命周期感知对于基于证据的科学发现至关重要,并为培养具备广泛能力的 AI 科学家提供了一条切实可行的途径。

论文:OmniScientist: An Omni-Modal Omni-Discipline AI Scientist

单位:新加坡国立、牛津

Project: https://omni-scientist.github.io/

下载论文https://t.zsxq.com/x11g8

请索引第124篇论文

当AI科学家开始"亲眼看数据":OmniScientist如何把科研智能体从"工作流搬运工"升级为"证据驱动的发现者"

AI for Science 的叙事,过去两年几乎被一句话霸屏:"从文献调研到代码实验再到论文初稿,全流程自动化"。听起来很美。但如果你真的在交叉学科一线做过研究,会本能地皱眉——流程跑通了,不等于科学做对了。一个AI系统可以完美地"写"出一篇材料科学论文,却从未真正"看"过那张扫描电镜图里的晶界形貌;它可以流畅地分析地震信号,却只读过人类预先抽好的标量特征,没听过那段波形里藏着的偏振结构。

这就是新加坡国立大学与牛津大学联合发布的 OmniScientist 这篇论文(Bobo Li, Hao Fei 等)想要撕开的核心问题:现有AI科学家是"工作流完整、证据残缺"的。

一句话先抛结论:这篇论文最有价值的不是"又做了一个科研智能体",而是它第一次把"让AI直接感知原始科学证据"做成了端到端闭环,并用 36 个真实跨学科案例证明——直接感知相对"只看预计算特征"的盲版本,在 7 个评审维度上全胜,两两对比胜率 85%,平均论文质量 6.3/10。

01 "工作流完整"是个伪饱和:AI科学家缺的不是步骤,是眼睛

作者开篇就抛出一个反直觉的判断:近期Foundation Model的进步,已经让AI科学家把"假设生成→代码执行→手稿准备"这条可见的工作流几乎走完了(他们点了Lu et al. 2026、Yamada et al. 2025、Schmidgall et al. 2025等一系列前作)。但是,工作流覆盖 ≠ 科学发现所需的全部证据可得。

为什么?因为绝大多数现有管道,是通过文本、代码、标签或人类预先算好的摘要来"接触"数据的。这一道接口,悄悄吃掉了科学上最致命的几类关系:

• 空间关系:病理切片里局部的核密度纹理,被一张caption抹平;

• 时间关系:候鸟GPS轨迹的顺序,被一个无序特征向量擦掉;

• 跨通道关系:三分量地震波形里的偏振结构,被几个标量特征掩盖;

• 过程关系:仿真轨迹的动态演化,被终止帧的代表值代替。

论文里有一句特别犀利的话:"The decisive issue is which relations survive the interface"(决定性的问题是——哪些关系活过了接口这道关)。

From raw observations through the engine to scientific discoveries

图1(即论文Figure 1)给出了OmniScientist的整体定位:它不是又一个"写论文的Agent",而是一个perception-first(感知优先)的端到端AI科学家。感知层贯穿始终,原始证据可以反向塑造"研究问题→实验设计→结果检验→最终论断"的每一个环节。

这是范式级的区别:以往的多模态模型测评,都是"人定好观测、人定好问题、AI来答";以往的科研Agent用感知,也只是在"看看自己画的图、给plot打个分"这种局部环节。OmniScientist是第一次让原始观测在整个研究生命周期里都有权"改主意"。

02 架构解剖:感知层 + 三个Agent + 一条"硬管线"

OmniScientist的技术骨架并不玄学,但设计哲学很硬核。

2.1 四个证据家族:把"多学科"抽象成"多证据类型"

作者做了一个非常漂亮的归一化:不管你做的是凝聚态物理还是海洋生物学,科学证据都可以归到4个与学科无关的家族(见Table 2):

• Perceptual(感知型):图像、视频、显微图、雷达、天文与遥感影像、科学图的视觉形态、音频、3D结构;

• Symbolic(符号型):自然语言文档、公式、变量、规则、序列、知识图谱、逻辑与因果关系;

• Quantitative-statistical(定量统计型):表格、测量值、分布、曲线、相关性、显著性检验、回归结果;

• Procedural(过程/动态型):实验步骤、代码执行、Agent轨迹、仿真、动态演化、协议。

这个分类的高明之处在于:换学科不需要改引擎,只需要写一个specification文件。同样的感知-构想-实验-写作循环,可以在地震波形、CAD网格、知识图谱上无缝切换,零领域专用代码。

2.2 感知层:先算后看,预算受限

感知层不是无脑把图像都渲染给大模型看。它的策略很克制:

1. 优先原生数值分析——直接从原始artifact里抽取FFT峰值、趋势点等数值特征;

2. 仅在空间/结构模式关键时才渲染视觉;

3. 视觉感知有预算上限,防止无目标地乱看,也控制成本。

这种"先算后看、算看结合"的设计,是工程上能跑通 36 个案例的关键。

2.3 三个Agent:Ideation / Experiment / Writeup

每个Agent内部都是一个ReAct循环(观察-推理-行动交替),但外面套着一条确定性的薄管线,由代码控制阶段切换:

• 实验崩了或出null结果?自动回退到构想阶段(最多2次);

• 每个阶段的输出,必须通过一个代码强制的检查才被放行。

2.4 三道代码级"红绿灯":这是论文最硬核的贡献

很多AI科学家系统靠"提示词"来约束行为,OmniScientist偏不——它把想法检查、严谨性检查、论断检查写成代码强制执行的gate:

• Idea Check:要求明确的研究问题、可伪证假设、实验草图、伪证准则;至少5个候选想法、至少3次聚焦文献检索;自动把"first""never explored"这种overclaim改写成"appears under-explored based on this search"。

• Rigour Check(Algorithm 1):报告指标不能为0;必须真跑过代码;每一个出现在文稿里的数字都必须能追溯到真实stdout;数据集必须从磁盘真正加载;报告≥2个p-value时必须做多重比较校正(而且分母要算上debug循环里所有试过的检验,防人工缩小分母);headline发现若来自事后分析则拒绝(anti-HARKing);不支持的分析降入执行轨迹,不进正文。

• Claim Check:写稿阶段再次审计论断与实验记录的一致性。

这一道道"红绿灯"解决的,恰恰是AI科学家最容易翻车的几个方法论深渊:数据泄漏、多重比较、HARKing(看了结果再编假设)、数值不可溯源。论文用代码而非prompt来卡死这些,是它能做出"可信论文"的工程基石。

03 36个真实数据案例:一套引擎,五大学科家族

评估套件本身就是一件艺术品(Table 1)。36个案例,覆盖5个学科家族、4个证据家族,模态从图像、信号、音频、视频、3D结构到轨迹、表格、公式、序列、场、图,无所不包:

• 物理科学(5例):凝聚态/纳米、振动光谱、材料信息学、分子化学、符号回归;

• 地球与空间(9例):遥感、星系形态、星系跨巡天、引力波、地震学、海洋生物、地质/岩石物理、气象、 cyclone动力学;

• 生命与医学(7例):病理学、放射学、医学影像CT、心脏学、睡眠神经科学、细胞生物学、基因组学;

• 农业与生态(8例):植物病理学、精准农业、动物行为、生态声学、海洋生物声学、植物表型、渔业、运动生态学;

• 工程与信息(7例):机械/CAD、土木/测绘、机器人/驾驶、工业声学、交通、科学计算、知识工程。

36个案例全部跑通了"原始数据→编译PDF"的完整路径。这不是demo,是full end-to-end。

04 6.3分意味着什么:跨主干网络的一致性表现

作者用Claude Sonnet 5作为主力推理主干,并在9个主干网络上做了对比(Table 3/4)。全量36案例的平均综合分为6.3/10(7个维度:新颖性、严谨性、清晰度、显著性、可复现性、多模态接地、事实准确性)。

几个值得圈点的发现:

第一,强主干网络表现高度一致。Sonnet 5 得 6.3,GLM-5.2 得 6.5,Kimi K2.7 得 6.5——不同闭源强模型聚在很窄的区间里。这说明论文质量的天花板更多由"感知+检查"的架构决定,而非单纯烧钱堆主干。

第二,跨模态、跨学科的性能差异在统计上不显著。按证据模态分组,图像/信号/音频/视频/3D/轨迹/表格与符号的分数中位数紧挨在6.1-7.1之间;按学科分组同理(Table 5/6)。一套引擎真的做到了学科无关。

第三,事实准确性在所有主干上都领跑。这与"每个数字必须追溯到真实程序输出"的硬性 provenance 检查直接相关——不管主干嘴皮子多溜,谎报一个数字就过不了gate。

Table 6 把36个案例逐学科的7维分数摊开,信息量极大。比如"振动光谱"拿7.0,"材料信息学"拿7.0,"符号回归"拿7.0,"地质/岩石物理"拿7.5,"生态声学"拿7.5,"渔业"拿7.0——大量案例稳稳坐在7分上下,对一篇全自动生成的论文而言,这是相当能打的成绩。

05 85%胜率:把"盲版"按在地上摩擦

论文最漂亮的一组实验,是把OmniScientist与一个盲版本做两两对比——盲版本只拿到预计算的标量特征,模拟传统文本型AI科学家的接口。

结果(Figure 7):

• 直接感知在7个评估维度上全面优于盲版;

• 两两对比胜率85%;

• 增益最大的两个维度是多模态接地(+2.8)和科学显著性(+1.8);

• 事实准确性两者都很高(因为都受同样的provenance约束)。

注意"+1.8显著性"这个细节:它说明多模态感知不只是让论文"看起来更对题",而是拓宽了这项研究能支撑的论断范围。AI因为亲眼看了数据,敢于提出更大胆、更有科学意义的问题。

机制分析进一步揭示:在5个配对案例中,感知版系统锚定在研究问题的属性,全部来自原始多模态记录中独有的线索——星系图像上的形态、三分量波形的偏振、病理tile的纹理、CAD点云的主轴几何、植物重复扫描的逐点器官标签。而盲版永远只能在预计算标量特征上打转,两者形成了完全不同的研究轨迹(Table 7)。

最戏剧化的例子是地震学案例:盲版仅靠文本特征名,设计了一个需要实际记录中不存在的数据字段的研究,被迫大量返工;感知版靠直接观测,从一开始就提出了可行、可立即执行的假设。

06 两个案例研究:AI真的"看出"了什么

论文给了两个极具说服力的端到端案例,我们挑重点讲。

6.1 地震学:噪声标签里的"幽灵信号"

STEAD数据集约1500条三分量宽带地震图,均匀分成"地震"和"噪声"标签。AI亲眼看波形时,发现一条被标为"噪声"的trace里,有明显的onset-decay包络——而按标签它应该只是平稳背景。

它没有粗暴改标签,而是把这道冲突转化成研究问题:有多大比例的噪声标签trace其实携带相干瞬态能量?

为此,AI自主设计了一个复合检测器,融合STA/LTA特征函数与振幅、直线性、平面性,以及跨通道一致性项。设定在3个标签无关替代零模型的99分位阈值上,系统确定:21.7%(750条中的163条)的噪声标签trace携带相干、偏振、跨分量瞬态突发,95%置信区间[18.8, 24.9]%。

消融实验显示:去掉跨通道一致性项,检测率塌到2.0%的纯振幅基线——Timing coincidence才是真正的机制驱动。估计值在50倍false-alarm率范围、3种零模型、4种窗长选择、以及跨越417个台站的台站聚类bootstrap下都稳定。当经验数据反驳了关于仪器类型的预注册假设时,系统客观地把"普遍性发现"放在headline,把仪器问题降级为边界结果。

Table 9 把所有数字摊开,每一个都追溯到真实的run_python标准输出。

6.2 儿科胸片:肺炎肺野的"斑片状"纹理

第二个案例更直观。AI拿到儿科正位胸片,只有"正常/肺炎"标签,没有预计算特征。它直接读片,观察到肺炎肺野不是均匀变亮,而是不均匀的斑片样——致密斑块与清晰区域相邻。

AI把这个观察转化成可量化指标:滑动窗口局部香农熵图的的空间离散度,并预指定假设——这种"斑片状"独立于整体熵水平,能分离两类标签。

结果发现(Table 10):空间异质性分离正常与肺炎肺野的效应量Cohen's d > 1.2,在训练集和留出集上都稳定。在多变量模型中,空间度量在平均熵之外提供显著协同增益,留出集峰值AUC达0.851。结构化解释还决定性击败了朴素原始像素基线(AUC 0.634),证明预测力确实来自高层空间抽象。

论文在这里点出了一个方法论上的关键:"识别空间异质性需要直接与胸片的固有属性视觉交互。系统必须主动观察这些空间模式,才能在量化之前概念化该度量——这一关键的归纳步骤,对文本绑定的统计数据挖掘是完全不可及的。"

这句话,其实就是整篇论文的题眼。

07 给AI+交叉学科研究的真正启发

作为在一线做AI+科学交叉的研究者,我认为这篇论文的价值远超"又出一个基准"。它给交叉学科研究者的启示至少有四层:

7.1 接口即假设:你给AI什么,决定了它能发现什么

很多交叉学科AI项目的失败,不是模型不行,而是数据接口把科学上最关键的关系切掉了。你把病理切片压成32维特征向量再喂给AI,就别指望它发现核密度纹理的新标志。OmniScientist的启示是——尽量让AI接触原始证据,并在感知预算与计算成本之间做主动管理。"先算后看、算看结合、预算受限",是一套可复用的方法论。

7.2 多模态不是"加点图像分支",而是研究闭环的重塑

很多论文把多模态当成"encoder拼一下"。OmniScientist证明:真正的多模态科研,是让原始观测有权重塑研究问题本身。如果你的多模态模型只能在"给定问题"下答得更好,那它只是个更强的分类器;只有当它能在"看数据"的过程中改变要问的问题,才算摸到了AI科学家的门。

7.3 自动化科学的命门是"防作弊",不是"提性能"

AI科学家最大的风险不是笨,是"太会圆"。HARKing、P-hacking、数字编造、选择性报告——这些在人类科学里靠同行评议来遏制,在自动化系统里必须在代码层卡死。OmniScientist用Algorithm 1把provenance、多重比较校正、anti-HARKing写成确定性gate,是这个方向的重要范本。

对做AI科研系统的同行说一句:如果你的系统允许Agent"自由生成数字再写进论文",那它产出的就不是科学,是小说。provenance check不是可选项,是必选项。

7.4 学科无关性的秘密:抽象到"证据家族",而非"学科名称"

OmniScientist能一套引擎跑36个案例,关键是把学科差异抽象成感知型/符号型/定量统计型/过程型这4个证据家族。这给交叉学科AI平台的架构设计提供了一个清晰模板:不要按"化学AI""生物AI"去堆烟囱,要按"证据类型"建能力中台

08 边界与冷思考

当然,作为严肃的学术解读,也要把边界讲清楚。

第一,6.3/10是"自动生成论文"的高质量,但不是"顶刊接收"的保证。论文自己也做了主干敏感性分析:事实准确性和严谨性在最大与最小模型间有2.9分差距,说明强推理主干仍是高质量发现的必要条件。多模态接地反而是最不敏感的维度(1.2分跨度)——这反过来印证,感知能力不是堆模型参数能换来的。

第二,"盲版85%胜率"是在5个有标量盲对照的案例上测的。这5个案例恰好是多模态价值最凸显的场景。在Table 1里另外8个以符号/统计/过程证据为主的案例,文本接口本就够用——这也是为什么作者特意把这8个案例作为"广度控制"。不要误读为"所有学科都需要全模态感知",精准匹配证据类型与感知策略,才是工程上明智的做法。

第三,系统依赖一个强感知模型(Claude Sonnet 5)固定提供所有原始观测,主干网络只负责推理。这个解耦设计让"感知贡献"可被隔离测量,但也意味着感知能力本身的上限由那个固定的感知模型决定。未来若换更强感知模型,上限还能再推。

第四,成本。一次完整的三阶段运行,费用在0.03到4.34之间(取决于主干),实验阶段占大头。36案例全跑通的总开销可控,但若要规模化到上千案例,成本工程仍需优化。

09 AI科学家的下一个十年

回到这篇论文最打动我的地方。它用一个极其简洁的判据,重新定义了什么是"AI科学家"——

不是"能写论文的Agent",而是"能因亲眼看见证据而改变自己研究方向的Agent"。

这个判据看似温和,实则苛刻。它要求我们在构建科研智能体时,把"感知"放在与工作流同等甚至更高的位置;要求我们接受,AI科学家必须像人类科学家一样,被原始数据的异常所"惊吓"、所"诱惑"、所"纠错"。

从AI+交叉学科的视角看,OmniScientist给出的不只是一个系统,而是一套哲学:科学发现的天花板,往往不在于你有多少算力、多强的模型,而在于你的AI有没有真正"看"到自然界原本的样子。当我们把地震波形压成标量、把病理切片压成标签、把分子结构压成SMILES字符串,我们就在不知不觉中替AI做了"哪些关系可以活过接口"的决定——而这个决定,本应是科学发现本身的一部分。

对图科学实验室的读者们说一句:无论你做AI for 地球科学、AI for 生物医学、AI for 材料、还是AI for 社会科学,OmniScientist这篇论文都值得你精读它的Appendix——尤其是Specification文件的写法、检查gate的代码逻辑、以及36个案例的逐案复盘。这些细节里藏着的,是下一代AI科学家系统的工程基因。

科学的本质,从来不是把世界翻译成机器能接受的符号,而是让机器学会直接面对世界的本来面目。OmniScientist朝这个方向走了结结实实的一步。至于下一步怎么走——也许,就该看在座各位的了。


微信群

内容中包含的图片若涉及版权问题,请及时与我们联系删除