WHALE: A Simple Recipe for Joint Harness-Weight Optimization

2026年08月31日
  • 简介
    智能体的性能同时取决于模型参数以及负责管理上下文和控制流的可执行“运行环境”(harness)代码。若仅单独优化其中任一组件,系统便可能被另一个保持不变的组件所制约:权重更新会改变哪种运行环境更为有效,而运行环境的更新又会改变模型哪些能力得以显现。当前主流的联合优化方法虽能同时调整模型权重与文本提示词(prompts),却仍将更广义的运行环境结构固定不变。为此,我们提出“权重—运行环境交替学习”(Weight-Harness Alternating LEarning,简称 WHALE)——一种简洁实用的学习范式,其核心在于交替执行两个阶段:首先在当前运行环境下更新模型权重,随后基于更新后的模型搜索更优的运行环境。我们分别采用在线拒绝采样微调(online rejection-sampling fine-tuning)和 Meta-Harness 方法来具体实现这两个阶段。何时切换阶段是关键的设计决策:为在区分真实性能提升与随机噪声的同时,避免因过度适配一个动态变化的搭档而导致过拟合,WHALE 采用两种策略之一——固定各阶段持续时长,或依据训练过程中的信号(如验证指标)设定自适应的“耐心等待”规则(patience rule)。我们在三大任务领域(网络搜索式问答、数学推理、国际象棋谜题)中,以 Qwen3.5-2B 和 Qwen3.5-4B 智能体为基线开展实验;结果表明,WHALE 在最优平均前8名准确率(best mean@8 accuracy)上,较仅优化权重、仅优化运行环境以及 Fast-Slow Training 等基线方法均显著提升,增益达 4.15 至 24.38 个百分点。值得注意的是,瓶颈既可能出现在权重端,也可能出现在运行环境端:例如,在搜索问答(SearchQA)任务中,仅通过运行环境搜索即可用远少得多的试运行次数(rollouts)达到仅优化权重所能获得的峰值准确率;而在数学推理任务中,运行环境的改进则必须依赖于权重更新之后才得以显现。此外,小步交替式的权重与运行环境联合更新,不仅在最终准确率上优于先集中优化权重、再集中优化运行环境的分阶段策略,而且在试运行开销(rollout cost)方面也更具效率。本工作的全部代码已开源,详见:https://github.com/krafton-ai/WHALE。
  • 作者讲解
  • 图表
  • 解决问题
    论文试图解决大模型智能体(agent)性能优化中模型权重(weights)与执行环境(harness)耦合依赖的问题:传统方法孤立优化权重或提示(prompt),但忽视了二者动态互依性——权重更新会改变最优harness,而harness变更又会暴露/抑制不同模型能力。这是一个被长期低估的新颖系统级优化问题,超越了经典prompt tuning或微调范式。
  • 关键思路
    提出Weight-Harness Alternating LEarning(WHALE):一种简洁、通用的交替优化框架,周期性执行两个阶段——(1)在固定harness下在线拒绝采样微调模型权重;(2)在更新后的模型上用Meta-Harness进行可执行harness结构搜索。其核心新意在于首次将harness视为可学习的*程序化组件*(而非仅文本prompt),并建立权重与harness的闭环协同进化机制,且通过固定步长或耐心机制(patience-based switching)避免过拟合噪声。
  • 其它亮点
    在Qwen3.5-2B/4B智能体上验证,涵盖SearchQA(搜索问答)、数学推理、国际象棋谜题三大任务;WHALE显著超越weight-only、harness-only及Fast-Slow Training(+4.15–24.38% mean@8准确率);发现瓶颈具有任务依赖性:SearchQA中harness搜索可快速逼近峰值性能(低rollout开销),而数学任务需先权重更新才释放潜力;小步交替优于分阶段优化(更高精度+更低总rollout成本);代码已开源(https://github.com/krafton-ai/WHALE);值得深入的方向包括:自动化harness表示学习、跨任务harness迁移、理论收敛性分析。
  • 相关研究
    Fast-Slow Training (ICML 2023); Prompt Optimization via Reinforcement Learning (NeurIPS 2022); Meta-Reasoning for LLM Agents (ACL 2024); Programmatic Prompt Engineering with LLMs (ICLR 2024); Self-Improving Language Models from Human Feedback (arXiv:2310.17617)
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问