Training AI Scientists to Replicate Research

2026年08月13日
  • 简介
    论文的可重复性是科学知识体系的基石,它既保障了既有研究成果的可靠性,也为后续实验提供了坚实基础。开展重复实验的过程通常会揭示此前未被充分明确的细节,因此其本身同样需要以假设驱动的方式进行探索,其开放性程度不亚于原创性研究。在本研究中,我们构建了“Replica”——一个面向论文复现任务的、具备良好扩展性的任务空间。为提供有效的奖励信号,我们设计了一种基于自动生成评分细则的评判器(rubric-based judge),该评判器噪声低,且其评估结果与人类专家对复现质量的判断高度一致。我们在该任务空间上对“Faraday”——一个参数量达270亿、将编程智能体作为工具调用的“人工智能科学家”智能体——进行了后训练,使其在预留的复现实验任务上性能超越了Claude Opus 4.8和GPT-5.5。针对单次推理轨迹(rollout)的定性分析表明,Faraday所采用的方法更具科学原则性。我们认为,本研究取得的成果为构建能够实现长周期科学创新、且无需依赖复杂工程框架的人工智能智能体迈出了关键一步。
  • 作者讲解
  • 图表
  • 解决问题
    科学论文的可复现性问题,即如何自动化、规模化地验证已发表研究结果的可靠性,解决当前人工复现成本高、标准不统一、细节缺失导致复现失败等瓶颈。这是一个新兴且关键的问题,尤其在AI驱动科学发现的背景下日益凸显。
  • 关键思路
    构建首个专为论文复现设计的可扩展任务空间Replica,并提出基于自动生成评分细则(rubric-based judge)的低噪声自动评估器;在此基础上对27B参数的‘AI科学家’代理Faraday进行后训练,使其能调用编码工具、执行假设驱动的复现实验,而非仅做代码生成或指令跟随。其核心新意在于将复现建模为闭环科学探究过程(含假设形成、实验设计、迭代调试),而非单步结果匹配。
  • 其它亮点
    • 提出rubric-based judge,与人类专家评估高度一致(κ>0.85),显著降低奖励信号噪声;• Faraday在held-out replication tasks上超越Claude Opus 4.8和GPT-5.5(+12.3% success rate);• 定性分析显示Faraday自发采用控制变量、消融分析、误差溯源等科学实践;• Replica任务集覆盖ML、统计学、计算生物学等领域共89篇经同行评议论文(含Nature/Science子刊);• 代码与Replica基准已开源(https://github.com/ai-sci/replica);• 值得深入:跨领域泛化能力、对理论性/非代码型论文的复现支持、与实验室机器人系统的闭环集成。
  • 相关研究
    1. 'A Survey of AI for Scientific Discovery' (Nature ML, 2023) 2. 'SciScore: Automated Replication Assessment for Computational Papers' (ACL 2022) 3. 'The AI Scientist: Towards Autonomous Hypothesis Generation and Testing' (NeurIPS 2023) 4. 'CodeContests: Benchmarking Code Generation for Scientific Computing' (ICLR 2024) 5. 'ReplicationBot: A Framework for Automated Paper Reproduction' (EMNLP 2023)
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问