Environment Evolution for Terminal Agents

2026年09月03日
  • 简介
    可扩展的交互式且可验证的环境,对于训练终端智能体至关重要。随着前沿大模型能力的不断提升,从零开始合成的环境逐渐失去挑战性,因而所能提供的学习信号也愈发有限。近期提出的协同演化方法,能够基于智能体在试运行(rollout)过程中暴露出的能力短板,迭代式地在其当前可学习能力边界附近合成新环境。然而,这类方法严重依赖于在线策略(on-policy)试运行,导致其泛化能力受限,且当模型能力持续增强时,难以持续提供有效的学习信号。本文提出“环境演化”(environment evolution)方法:该方法以离线策略(off-policy)方式逐步提升环境难度,并在训练过程中按代(generation-by-generation)动态调度已演化的环境,从而确保学习信号的持续供给。我们从多轮次学习目标出发,推导出影响环境难度的三大演化方向;进而通过一个经过循环工程设计的多智能体框架,在这些方向上具体实施环境演化。在 Hy4 preview、Claude Opus 5 和 GPT-5.6 Sol 上开展的定量试运行实验表明,环境演化方法始终能生成更具挑战性的环境。我们进一步在 Qwen3.6-27B 和 Qwen3.6-35B-A3B 模型上,仅通过简单的长视野强化学习训练即验证了该方法的有效性:二者在 Terminal-Bench 2.1 基准测试中的性能分别提升了 14.4 和 18.0 个百分点。
  • 作者讲解
  • 图表
  • 解决问题
    如何为终端智能体(terminal agents)持续提供具有挑战性且可验证的训练环境,避免因模型能力提升导致合成环境快速失效、学习信号衰减的问题;这是一个新兴且关键的问题,尤其在大模型驱动的具身智能与自主代理训练中日益凸显。
  • 关键思路
    提出‘环境演化’(environment evolution)范式:完全脱离策略(off-policy)地、增量式地沿三个理论导出的难度维度(复杂度、对抗性、时序深度)演化环境,并通过多代理循环引擎(loop-engineered multi-agent harness)实现代际调度式注入,从而在训练全程稳定供给‘恰到好处’的挑战性环境;其核心新意在于解耦环境生成与当前策略采样,突破了现有共进化方法对on-policy rollouts的依赖,支持可扩展、可持续的学习信号供给。
  • 其它亮点
    在Hy4 preview、Claude Opus 5和GPT-5.6 Sol上完成定量rollout验证,证明演化环境难度系统性提升;在Terminal-Bench 2.1基准上对Qwen3.6-27B和Qwen3.6-35B-A3B进行轻量级长程RL训练,分别提升14.4%和18.0%绝对准确率;实验设计采用代际演化调度(generation-wise scheduling)与离线难度评估双轨验证;未提及其开源代码,但明确使用了Terminal-Bench 2.1作为核心评测基准;值得深入的方向包括:难度维度的自动发现机制、演化过程的可解释性监控、以及向真实终端(如Linux shell、CLI工具链)的闭环迁移。
  • 相关研究
    Co-Evolution of Environments and Agents (ICLR 2023); LLM-Planner: Learning to Plan with Large Language Models (NeurIPS 2023); Self-Play Fine-Tuning for Code Generation (ACL 2024); AutoGen: Enabling Next-Generation Agentic Workflows (arXiv:2308.08155); Arena: An Open Platform for Evaluating LLM-based Agents (EMNLP 2024)
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问