Engineering Reliable Coding Agents: Evaluating and Operating the System Around the Model

2026年08月14日
  • 简介
    人工智能编程智能体通常以模型形式接受评估,却以完整系统形态投入实际部署。其可靠性不仅取决于模型自身的能力,更受到运行框架(harness)、执行状态、检索机制、记忆与状态管理、权限控制、代码审查接口以及资源分配等多重因素的共同影响。 本专著深入考察了上述各环节之间的边界,并据此构建了一套用于可靠评估与运维编程智能体的系统性框架。研究采用结构化的多源证据综述方法(multivocal review),综合整合了164项学术研究成果、100份一线实践记录、29项基准测试报告,以及17个作者自建系统的案例记录;同时辅以定向更新审计(targeted update audits)、软件工程覆盖度分析(software-engineering coverage analysis)和分布式系统实证合成(distributed-systems evidence synthesis)等多元验证手段。 基于上述广泛而扎实的实证基础,研究发现:许多表面上归因于模型失效的问题,实际上源于系统其他环节;而某一层级的改进,往往难以有效传导至端到端的整体效果。因此,评估与运维应被视作一条环环相扣的依赖链——任务构建、执行环境、检索机制、状态管理、结果验证或可观测性等任一环节存在薄弱点,均可能导致下游所有分析结论失效。 本专著的核心贡献包括: • 一份版本化、可追溯的《可靠性记录目录》,共收录206项条目,其中193项为经审慎把关的实践规范(gated practices),含56项深度开发的成熟实践;另含13项待深入探索的研究方向; • 一份详实的实证台账(evidence ledger),系统记录各项主张所依据的证据来源与强度; • 一套刻画智能体全生命周期中“依赖关系”与“修复不对称性”(dependency and repair asymmetry)的分析框架; • 来自真实运行中编程智能体系统的量化指标与典型故障案例; • 一套可直接运行的评估协议与可靠性保障协议(runnable evaluation and reliability protocols); • 五种经实证验证、可复用的智能体核心能力(agent skills),并附有对应的能力—证据映射图(evidence maps)。 上述成果共同构成了一套面向系统层级的方法论,助力研究者与工程师清晰区分“模型固有能力”与“基础设施效应”,科学设计具备抗辩力(defensible)的评估方案,并构建出在组件发生故障时仍能安全恢复的鲁棒系统。 需要说明的是,本次综述采取结构化而非穷尽式路径,不同主题下所获证据的强度存在差异,最终结论亦随具体工作负载(workload)与系统配置(configuration)而动态变化。方法论部分明确记载了已完成的检索路径(search lanes)、尚未开展的检索方向,以及各项证据评级声明所存在的固有局限。
  • 作者讲解
  • 图表
  • 解决问题
    AI coding agents常被当作纯模型评估,但实际部署为复杂系统;其可靠性不仅取决于模型能力,更受执行环境、检索、状态管理、权限控制、验证接口、资源调度等系统层因素制约。论文旨在揭示‘模型失败’常实为系统层失效,并建立可操作的系统级可靠性评估与运维框架,解决当前评估与部署脱节、归因错误、改进不可传递等根本性问题。
  • 关键思路
    提出‘依赖链’(dependency chain)视角:将编码代理的评估与运行视为由任务构造→执行环境→检索→状态管理→验证→可观测性构成的强耦合链条,任一环节薄弱都会使下游结论失效;强调‘修复不对称性’(repair asymmetry)——底层故障的修复未必提升端到端可靠性,需跨层协同设计;通过多源证据融合(学术+工业+基准+实操案例)构建版本化、可验证的可靠性实践目录,实现模型能力与基础设施效应的可分离归因。
  • 其它亮点
    综合164篇学术文献、100份工业实践记录、29个基准报告和17个作者亲验系统案例;发布206条可靠性记录(193条带门控条件的实践指南,含56条深度开发项,13条研究方向);提供证据账本(evidence ledger)、可运行评估协议、5个带证据映射的可复用代理技能;所有协议均开源可执行;实验设计强调‘操作真实性’——基于真实部署失败案例反向审计系统边界;未依赖单一模型或闭源API,聚焦架构与工程决策;值得深入的方向包括:状态漂移的量化检测、权限-检索-执行的联合验证协议、面向LLM代理的SLO定义范式。
  • 相关研究
    ‘A Survey on Evaluation of Large Language Model-based Agents’ (ACL 2024); ‘AgentBench: Evaluating LLM-based Agents in Realistic Environments’ (NeurIPS 2023); ‘The Unreliable Agent: A Diagnosis of Reasoning Failures in LLM-Based Systems’ (ICML 2024 Workshop); ‘CodeAct: An Interactive Execution Environment for Code Generation Agents’ (arXiv 2024); ‘Stateful Agents: Modeling Memory and Context in Agentic Workflows’ (OSDI 2023)
许愿开讲
PDF
原文
点赞 收藏
向作者提问
NEW
分享到Link

提问交流

提交问题,平台邀请作者,轻松获得权威解答~

向作者提问