纵观当前前沿研究,无论是优化长程任务中的状态管理、让智能体自主学习外部记忆使用策略,还是依据失败经验持续改进运行机制,其核心目标都指向同一个方向——突破单一模型能力边界,为智能体构建能够持续执行、学习与自我进化的运行基础设施。这一趋势的核心,正是近年来快速发展的「Agent Harness」。

Agent Harness 是包裹在大语言模型之外的运行层,负责构建上下文、管理状态、协调工具调用与验证执行结果,让模型真正具备完成复杂任务的能力。简而言之,它正在为大模型补上从「思考」到「行动」的关键一环,推动人工智能从单一模型迈向能够持续学习、稳定执行和不断进化的自主智能体。

本周,HyperAI 为大家精选了 8 篇 Agent Harness 领域的最新研究,研究团队涵盖上海交通大学、密歇根大学等顶尖学府,以及谷歌、字节跳动、小红书等科技巨头。相关论文围绕长程任务执行、自演化与智能体评估等方向展开,为构建更具自主性、自学习与持续进化能力的下一代智能体提供了全新思路。一起来学习吧!⬇️

此外,为了让更多用户了解学术界在人工智能领域的最新动态,HyperAI 官网现已上线「最新论文」板块,及时跟进前沿 AI 研究。

最新 AI 论文:https://go.hyper.ai/hzChC

本周论文推荐

HarnessDev

论文题目:

HarnessDev: Can LLMs Create and Evolve Their Own Agent Harness?

来自字节跳动 Seed、新加坡科技设计大学、佐治亚理工学院的研究人员提出 HarnessDev,用于评估软件智能体自主创建和演化 Agent Harness 的能力。该基准将评估重点从传统的任务输出转向可运行的执行基础设施,要求智能体从最小化种子和少量案例出发构建完整框架,并根据下游任务反馈持续迭代优化。

HarnessDev 覆盖代码、搜索、写作和机器学习等 4 个领域,包含 5 个下游评估基准和 2,207 个独立实例。对 6 个前沿语言模型的实验表明,当前模型生成的执行框架在写作和机器学习实验任务上已达到甚至超过人工设计的参考框架,但在代码和搜索任务上仍存在明显差距,且不同框架的执行成本差异较大。进一步实验发现,框架演化虽然能够带来一定性能提升,但增益并不稳定,仅能部分迁移到隐藏任务,并且高度依赖具体的执行模型,显示出有限的跨模型泛化能力。

论文及详细解读:https://go.hyper.ai/bCYfx

图片

HarnessDev 框架示意图

数据集构成与来源:该基准包含 2,207 个唯一的下游实例,来自 4 个领域的 5 个基准。作者重点关注 Evolution 阶段的两个代码领域基准:SWE-Pro 和 Terminal-Bench。这些是成熟的开源任务套件;论文固定了它们的版本和许可证。

图片

数据集

EnvHarness

论文题目:

EnvHarness: Awakening Static Worlds for Agent Learning

华盛顿大学圣路易斯分校、Google Cloud 和北卡罗来纳大学教堂山分校的研究者提出 Environment Harness(EnvHarness)用于解决大语言模型智能体训练环境静态、难以随智能体能力动态演化的问题。该方法通过一个由可插拔组件构成的可编程层包装原始静态环境,在不修改底层逻辑和原始验证器的前提下,重新设计初始状态、智能体交互方式及任务结构。

实验表明,相比原始静态环境和领域特定的环境生成方法,该框架均取得更优表现,在留出测试实例上最高实现 9.0 个点的性能提升,同时将执行步骤减少 9.8%。

论文及详细解读:https://go.hyper.ai/BH4S7

图片

EnvHarness 框架概述

HarnessEval-W

论文题目:

HarnessEval-W: Agentifying the Evaluation of Visual Worlds

来自卡内基梅隆大学、巴黎综合理工学院、密歇根大学及其他机构的研究人员提出了 HarnessEval-W,用于解决世界模型评估过度依赖单一分数、缺乏可解释推理过程的问题。该方法将 LLM 智能体中的 harness 范式引入世界模型评测,通过理解具体评估案例,将复杂问题拆解为多个可测量的子问题,并为其生成配备专门上下文和诊断工具的子智能体。

HarnessEval-W 在 18 个代表性世界模型和 330 个评估案例上进行了测试,覆盖观察质量、状态转移正确性和世界持久性等能力。实验结果表明,该方法的评估判断与人类偏好高度一致,同时能够针对每段生成轨迹提供细粒度、可验证的诊断信息。

论文及详细解读:https://go.hyper.ai/CBZYG

图片

HarnessEval-W 框架示意图

数据集构成与来源: 作者构建了 HarnessEval-W,作为一个包含 330 个案例的基准,用于评估世界模型。每个案例包括一张初始图像、一份动作规范(包含文本指令、相机轨迹、控制序列、rollout 计划和物理参数条件),以及与一个探针族相关联的预期结果。

图片

数据集

EvoHarness-RL

论文题目:

EvoHarness-RL: Learning Self-Evolving Runtime Harness for Long-Horizon LLM Agents

针对长程 LLM 智能体难以有效构建和协调外部状态的问题,伊利诺伊大学厄巴纳-香槟分校和 Meta AI 的研究人员提出 EvoHarness-RL,让智能体学习可训练的运行时 harness 策略。技术层面上,该方法将 Belief、Progress 和 Experience(BPE)结构化为外部状态,并结合监督式 harness 微调与成本感知 GRPO,使智能体能够在长程交互中选择性地读取、更新和整合外部信息。

实验表明,基于 Qwen3-8B 的 EvoHarness-RL 在 ALFWorld 上达到 96.9% 的成功率。进一步分析发现,训练过程中会出现「harness 退火」和「harness 演化」现象:智能体逐渐减少对外部状态的频繁调用,并将经验提炼为更紧凑、更具任务适应性的状态基底。

论文及详细解读:https://go.hyper.ai/BPD5V

图片

EvoHarness-RL 框架示意图

Harness-R1

论文题目:

Harness-R1: Learning to Edit Executable Runtime Harnesses from Agent Failure Trajectories

针对 LLM 智能体持续积累交互经验却难以自主优化运行时 Harness 的问题,上海交通大学、小红书公司和东南大学的研究者提出 Harness-R1,通过在线强化学习来学习基于失败条件编辑可执行运行时 harness。实验表明,在 WebShop、ALFWorld 和 DBBench 上,该方法将原始 Qwen3.5-9B 的成功率从 44.3% 提升至 53.6%,并可进一步提升微调后智能体的性能,为 Harness 工程师与目标智能体的协同进化提供了新思路。

论文及详细解读:https://go.hyper.ai/zEGFs

图片

Harness-R1 框架概述

FinanceHarness

论文题目:

FinanceHarness: Autonomous Financial Deep Research Framework

针对通用深度研究智能体缺乏金融专业知识、且容易受到未来信息泄露影响的问题,Google Cloud AI Research 与加州大学洛杉矶分校推出 FinanceHarness 与 FinanceGym,分别用于构建端到端自动化金融研究流程和提供可验证、时间点明确的评测标准。实验表明,即使领先的 LLM 和智能体在 FinanceGym 上的得分也不足 40%,而在相同开源基座模型下,FinanceHarness 可将总体评分从 25.3% 提升至 32.4%,展现出自动化金融深度研究的应用潜力。

论文及详细解读:https://go.hyper.ai/93Pss

图片

框架示意图

数据集构成与来源: 研究团队在时点金融搜索沙盒之上构建 FinanceGym。该沙盒基于一个包含超过 1 亿篇文章的大规模网络语料库,这些文章来自数千个公共网络域名。每篇文章都带有可靠提取的发布日期,并通过标准化的元数据获得干净的文本。语料库特意保留了网络规模金融搜索的噪声和广度。

图片

数据集

LongHorizon-Harness

论文题目:

LongHorizon-Harness: Advancing Long-Horizon Agents for Real-World Tasks

针对长程 LLM 智能体在持续增长的上下文中难以追踪任务状态、且错误自我评估容易传播的问题,阿里巴巴 DreamX 团队提出 LongHorizon-Harness。该方法将长程任务执行重新定义为显式的状态管理问题,通过「管理—执行—审计(MEA)」循环维护任务状态,并仅依据环境中可独立验证的事实更新后续决策。

实验表明,LongHorizon-Harness 在多个模型和任务环境中均实现稳定提升:将 Qwen 3.7-Plus 在 WeaveBench 上的得分从 51.8% 提升至 80.7%,并在 Terminal-Bench 2.1 和 OSWorld 2.0 上取得明显增益;同时,Claude Opus 4.7 在 OSWorld 2.0 子集上的表现也从 20.0% 提升至 34.3%,展现出良好的跨模型与跨框架泛化能力。

论文及详细解读:https://go.hyper.ai/hxMb7

图片

LongHorizon-Harness 方法概述

What makes a harness a harness

论文题目:

What makes a harness a harness: necessary and sufficient conditions for an agent harness

针对「智能体 Harness」概念使用混乱、与智能体框架、SDK、IDE 插件等边界模糊的问题,戈亚斯联邦研究所的研究人员通过概念分析追溯其从传统测试 Harness 到机器学习评估 Harness 再到智能体 Harness 的发展谱系,并提出了一套可操作的定义标准。该定义给出了系统成为智能体 Harness 的必要与充分条件,并通过包含与排除测试明确了相关概念之间的边界。

研究团队进一步将该定义应用于 Claude Code、Codex CLI、Aider、Cline、OpenHands 和 SWE-agent 等六个真实编码智能体系统及多个边缘案例,验证了其分类的一致性。该研究最终建立了一套共享的概念词汇,为智能体 Harness 的工程设计、系统比较与后续研究提供了更清晰的理论框架。

论文及详细解读:https://go.hyper.ai/q81TX

图片

agent harness 方法概述

以上就是本周论文推荐的全部内容,更多 AI 前沿研究论文,详见 hyper.ai 官网「最新论文」板块。

同时也欢迎研究团队向我们投稿高质量成果及论文,有意向者可添加神经星星微信(微信号:Hyperai01)。

下周再见!

内容中包含的图片若涉及版权问题,请及时与我们联系删除