Skip to content
Dormon's Hideaway
Go back

AHE框架:执行层约束优于提示词调优

来源:X @AlphaSignalAI

AHE(Agentic Harness Engineering,代理工具链工程)由复旦大学、北京大学等机构的研究者提出,论文题为 “Agentic Harness Engineering: Observability-Driven Automatic Evolution of Coding-Agent Harnesses”(arXiv 2604.25850,代码以 MIT 许可开源)[0]。该框架的结论是:编码代理性能的关键不在提示词,而在代理周围的全部组件。实验显示,仅把系统提示词作为唯一调优面,性能会下降;而把代理周围一切组件作为整体自动演化,一个只带 bash 工具的种子代理经过 10 轮迭代(Terminal-Bench 2 的 89 个任务,每任务 2 次 rollout,GPT-5.4 高推理档,总时长约 32 小时),pass@1 从 69.7% 升至 77.0% [0]。同一轮运行也超过三个人类设计的 harness(opencode 47.2%、terminus-2 62.9%、Codex-CLI 71.9%)和两个自演化基线(ACE 68.9%、TF-GRPO 72.3%)[0]。本文拆解 AHE 的机制、证据与局限,并说明其核心命题——执行层约束优于文本建议——为何成立。

提示词:被高估的调优面

编码代理的能力不只来自模型本身,还来自模型周围的一切:系统提示词、工具定义、中间件、技能、子代理与记忆,这些合称 harness [0]。生产团队传统上靠人工检查轨迹、编辑文件来调优这些部分,循环慢,收益散落在无法记录的决策里 [0]

问题在于,所有人默认第一个该调的是提示词。AHE 的对照实验显示,仅把系统提示词作为唯一的适应面,Terminal-Bench 2 上的 pass@1 就降低 2.3 点 [0]。这不是人类独有的倾向:把编码代理当作优化器去改进另一个代理时,除第一阶段外,各阶段超过 50% 的修改同样是提示词层面的 [12]。提示词层面的自动化确实能涨分,但有代价:进化式提示词优化在 HumanEval+ 上把 pass@1 提升约 6–10%,token 用量同时增至 2.2–3.2 倍,MBPP 上 2.7–3.5 倍,BigCodeBench 上 6–8 倍 [34]。提示词工程实践者也承认:简单提示优化存在回报递减的极限,需要结合工具改进等其他技术 [10]

提示词无法支撑代理的可靠性,因为它是软约束:告诉模型 “应该做什么”,却无法强制执行 “不能做什么”。面对多步推理、文件操作与状态保持,纯文本指令拦不住代理破坏已验证状态 [0]。执行层的钩子(hooks)则不同:运行时决定钩子是否执行,模型没有否决权 [25];提示词引导行为,钩子保证条件满足时动作必然执行 [26]。这个反差是理解 AHE 的关键,而 AHE 把这一原则推广到了整个 harness 的自动演化。

可观测性驱动的演化闭环

把代理整体当作演化对象并非 AHE 首创:此前已有报道用演化算法改进编码代理,80 轮迭代把 SWE-bench 分数从 20% 提到 50%,还胜过固定外部系统的改进方式 [35]。AHE 的不同在于演化对象:它演化全套 harness 组件而非提示词或权重,且每次编辑都要在下一轮任务结果上被验证 [0]

种子 harness 设计得极简:只有一个 bash 工具,没有中间件和技能,因此每个后续加入的组件都必须靠实测 rollout 证明自己的位置 [0]。框架在 NexAU 基座上把 harness 实例化为七个可编辑组件类型,以固定挂载点的文件暴露:系统提示词、工具描述、工具实现、中间件、技能、子代理配置、长期记忆 [0]。每个逻辑编辑对应一次 git commit,文件级 diff 与回滚无需额外成本 [0]。把 harness 视为代理的一部分,对 harness 的更新在效果上就等同于参数更新 [38]

闭环建立在三层可观测性上:组件可观测性指每个失败模式干净地映射到一个组件类 [0];经验可观测性指 Agent Debugger 把原始 rollout 轨迹(百万级 token)蒸馏成分层证据库,每条轨迹消息一个文件,逐任务根因报告给出失败模式,基准级概览作为演化代理的入口,原始轨迹保留可查但从不先读 [0];决策可观测性指每次编辑附带 change_manifest.json 条目,写明针对的错误模式、预测修复的任务、可能的回归与约束层级(提示词、工具描述、工具实现、中间件、技能)[0]

下一轮,系统把预测的修复与回归同观测到的任务级增量取交集,无法兑现的编辑在文件粒度自动回滚 [0]。归因先于蒸馏:上一轮编辑的裁决落入演化代理要读的证据库,把每个 manifest 条目变成契约而非理由 [0]

演化代理本身被限制在 workspace/ 内:runs/ 目录、tracer、verifier 与 LLM 配置全部只读,种子系统提示词不可删除 [0]。这排除了不受约束的自修改器会采用的捷径(例如关掉 verifier 或提高推理预算),使每个记录的增益都能归因到 harness 编辑 [0]

消融:增益藏在基线不碰的组件里

消融实验最能说明问题:把 AHE 的单个组件换进 bash 种子,仅记忆 +5.6pp,仅工具 +3.3pp,仅中间件 +2.2pp,仅系统提示词 −2.3pp [0]。ACE 与 TF-GRPO 这类自演化基线从不编辑的组件,正是增益所在 [0]

执行层约束有效并非 AHE 一家的结论。钩子之所以有用,是因为模型不能决定你的代码是否运行 [25];失败模式目录同样指向执行层:代理自己宣布成功(self-grading)、为通过测试写假实现(test gaming)、自动执行高风险操作(unsafe action),这些在提示词层面只能被建议,在执行层才能被阻止 [40]。这也是 harness 工程被单独研究的原因:它由约束、反馈环、质量门禁构成,而标准 CI 流水线拦不住 AI 生成代码特有的问题 [29]。生产中的观察也一致:代理以机器速度优化任务完成,并不理解组织的风险 [13]

四个失败轨迹:自我验收漏洞与执行层修复

论文追踪了第 2、5、6、8 轮四个从失败到修复的完整轨迹,best-so-far 曲线的每个峰值对应其中一条 [0]

四个案例的模式一致:提示词给出行为建议,执行层施加硬性限制,改变结果的是后者——四个胜利修复里三个落在工具实现或中间件层 [0]。唯一的提示词修复(db-wal)能成功,靠的是规则恰好跨任务迁移 [0]。这与失败模式目录互相印证:self-grading 的防护是外部验证器,unsafe action 的防护是权限策略 [40]

迁移:学到的是协调模式,不是任务

如果 AHE 只是把 Terminal-Bench 2 刷高,意义有限;其价值在于迁移。同一套演化出的工作区原样用于 SWE-bench-verified(七个仓库 500 个任务),聚合分数 75.6% 为最高,同时比种子少花 12% 的 token,比 TF-GRPO 少 21%,比 ACE 少 32%;按 Succ/Mtok 计的成本效率 1.64,高于种子的 1.43、TF-GRPO 的 1.27 和 ACE 的 1.10 [0]。这与提示词层面的进化形成对比——那些方法提升分数的代价是 token 用量翻倍以上 [34]。token 消耗不可忽视:SWE-bench 的评估协议里,token 消耗随对话历史近似二次增长 [59]

跨模型迁移是 “harness 编码了通用工程经验” 的最强证据 [0]:同一工作区不重新演化,直接评估五个备选基座模型,全部正增益——deepseek-v4-flash +10.1pp(51.7→61.8)、qwen-3.6-plus +6.3pp(56.2→62.5)、gemini-3.1-flash-lite-preview +5.1pp(36.5→41.6)、GPT-5.4 medium 与 xhigh 各 +2.3pp [0]。弱基座获益更大,因为它们依赖 AHE 固化在工具、中间件与记忆里的协调模式;强基座可以用便宜的提示词重新推导同样的协调 [0]

局限:归因之外的三个盲区

AHE 的局限也需要关注。Hard 档下滑:在 Easy 与 Medium 档 AHE 全面领先,Hard 档以 53.3% 落后于 Codex-CLI 的 56.7%,归因于组件间干扰而非能力缺失 [0]。记忆、中间件与系统提示词都朝 “闭卷式验证” 演化,消耗回合预算在冗余复查上;但只把 AHE 的长时记忆换进种子(不带其他组件)就已超过 Codex 在 Hard 上的表现 [0]

非加性:三个正向单组件增益相加 +11.1pp,全量 AHE 只有 +7.3pp,堆叠损失 3.8pp [0]。原因是演化代理优化的聚合指标被 55 个 Medium 任务主导,收敛到偏向 Medium 的折中,退回了一部分 Hard 上的记忆效应 [0]

回归盲点:九个评估轮次里,演化代理发出 43 条回归预测,仅 5 条命中(精度 11.6%);实际发生 40 次未预见的回归(召回 11.1%)[0]。修复预测高于随机 5 倍,回归预测只高 2 倍——代理能论证一个编辑为何有用,却无法可靠地说出同一个编辑会破坏什么 [0]

基准范围:完整演化运行只在 Terminal-Bench 2 上进行,作者自己指出,换一个非 Terminal-Bench 2 的基准再跑一轮演化,才能回答 “刷榜” 问题 [0]。对基准数字本身也应谨慎:编码代理长期在基准上表现优异,却难以在生产中依赖 [36];基于公开数据构建的基准存在污染风险,自动化评分难以尽善尽美,甚至出现过模型未获额外信息就一字不差输出金标准补丁的情况 [66]

把 AHE 当作受控研究原型看待是合理的:它已经产出一个值得研究的冻结 harness,“收据”(change manifests 加自动回滚)把自我辩护换成了测量 [0]。要走向生产级,还差两件事:补上回归盲点,以及第二个基准上的演化运行 [0]。对实践者,含义是明确的:有了把每次组件编辑变成可证伪契约的可观测性原语,ML 工程师可以针对基准自动演化编码代理的工具、中间件与记忆 [0];它适合长地平线、多步终端或仓库工作流的团队,不适合短地平线 API 调用链或没有 rollout 轨迹与二元验证信号的团队 [0]。框架的影响范围最终取决于 NexAU 这类基座的普及——它触达多远,与采纳文件级组件契约的生产代理有多少成正比 [0]

参考来源

  1. 素材原文(见文首来源链接)
  2. AI Agentic Programming: A Survey of Techniques, Challenges, and Opportunities
  3. What Is the AI Agent Loop? The Core Architecture Behind Autonomous …
  4. Agentic AI Explained: From Theory to Implementation
  5. What Is Agentic AI: The Next Frontier in Autonomous Systems
  6. What Are AI Agents? | IBM
  7. Prompt自动优化-大模型服务平台百炼(Model Studio)-阿里云帮助中心
  8. 你还在手写 Prompt?聪明的人早就用上了循环工程,AI 的自动驾驶时代来了-钛媒体官方网站
  9. 2.7 提示词优化与调试:工程学视角 | Claude 技术指南 | Claude Guide
  10. 提示词工程最佳实践 | Jimmy Song
  11. meng shao on X: “如何打造高效 AI Agents:11 种提示词工程技巧,来自 @augmentcode 联合创始人 @guygr 什么是提示词工程? 提示工程是通过改进输入提示(包括系统提示、工具定义、工具输出、用户指令等)来提升 AI 模型在特定任务上的表现。提示是模型理解任务的唯一依据,类似于与人沟通,而非传统编程 https://t.co/HERwT1KMAA” / X
  12. 提示词优化的自动化探索:Automated Prompt Engineering
  13. VeRO: A Harness for Agents to Optimize Agents
  14. Balancing speed and safety: A control framework for AI coding agents | AWS Security Blog
  15. Future-Proof Coding Agents – Bill Chen & Brian Fioca, OpenAI
  16. 25 Best Prompts for AI Coding Agents | SSOJet - Enterprise SSO & Identity Solutions
  17. Abstraction: How AI Systems Manage Complexity Through Layered Representations
  18. Autonomous Coding Agents Beyond Productivity | C3 AI
  19. 企业级AI编程:从“代码补全”到“系统交付”的跃迁-腾讯云开发者社区-腾讯云
  20. Vibe Coding 从入门到精通教程|AI 结对编程工作流
  21. 企业级 AI Coding 如何治理?从代码生成到交付链路的管控框架-网易Codewave
  22. AI Coding 如何真正实现企业级的生产力-新闻中心
  23. Codacy | 企业级 AI 加速开发安全解决方案 - DevSecOps 平台 - 艾体宝IT
  24. 2026 年最佳 AI 安全编码工具 | Xygeni
  25. Medium
  26. Agentic Coding Hooks: Deterministic AI Guardrails
  27. Quality Gates for Coding Agents: How Stop Hooks Add Validation Checkpoints | fbakkensen
  28. AI Coding Tools in Enterprise Software Delivery
  29. Balancing speed and safety: A control framework for AI coding agents | AWS Security Blog
  30. Harness Engineering for AI Coding Agents: Constraints That Ship Reliable Code | Augment Code
  31. 你还在手写Prompt?聪明的人早就用上了循环工程
  32. 12.1 自动化提示词生成技术 | 大模型提示词工程指南 | Prompt Engineering Guide
  33. 充分释放大模型的潜力——提示词工程的16 种方式
  34. 提示词优化的自动化探索:Automated Prompt Engineering …
  35. Automated Prompt Engineering for Cost-Effective Code Generation Using Evolutionary Algorithm
  36. AI Coding Agents Use Evolutionary AI to Boost Skills - IEEE Spectrum
  37. AI coding agents go real as benchmarks mature and tooling evolves. | Revolter
  38. Benchmarking coding agents at the limits of human abilities with Rajan and Evan from Proximal
  39. A Taxonomy of Self-evolving Agents
  40. 从 Prompt Engineering 到 Loop Engineering:AI 编程正在进入“闭环工程”时代-腾讯云开发者社区-腾讯云
  41. Loop Engineering,给 AI Agent 设计可验证的自我迭代循环 | Misaka’s blog
  42. 从 Prompt Engineering 到 Loop Engineering:AI 编程正在进入“闭环工程”时代 - 猿人谷 - 博客园
  43. Loop Engineering 解析,大神都不寫 prompt 了?
  44. 什么是循环工程Loop Engineering | Coding Agent | 子Agent | MCP协议 | 提示词工程 | AI开发效率 | 软件研发 | Addy Osmani
  45. Loop Engineering 火了:AI Agent 开始自己干活,公司准备好背锅了吗?_循环_问题_ReAct
  46. ResearchLoop: An Evidence-Gated Control Plane for AI-Assisted …
  47. What Is Loop Engineering? AI Feedback Loops | Kilo
  48. What Is Loop Engineering? The New Meta for AI Coding Agents | MindStudio
  49. What Is Loop Engineering? | IBM
  50. Can anyone explain me “loop engineering” like I’m 5? It just keeps making no sense to me. : r/AI_Agents
  51. Loop Engineering
  52. 提示词自动优化(2)| 2023 ICLR经典工作APE:大模型自己就能当顶级提示词工程师-51CTO.COM
  53. Automatic Prompt Engineer (APE) — 自动化提示工程
  54. 大语言模型自动化提示工程技术研究综述
  55. LangChain自动化提示词优化指南 – Neo的胡言乱语
  56. LangChain自动化提示词优化指南 – Neo的胡言乱语
  57. 优化提示词 - 苏米客
  58. The SWE-Bench Illusion: When State-of-the-Art LLMs …
  59. Best LLMs for Coding in 2026: SWE-bench, HumanEval, and LiveCode …
  60. SWE-bench Verified
  61. AI Coding Benchmark Leaderboard 2026: Code Generation and SWE-bench | CodeSOTA | CodeSOTA
  62. Understanding LLM Code Benchmarks: From HumanEval to SWE-bench
  63. Code Generation and Repository-Level Software Engineering Benchmarks — A Field Guide to LLM…
  64. Dissecting the SWE-Bench Leaderboards
  65. SWE-bench | EvalScope - Read the Docs
  66. 生产环境中的 Agentic Coding:SWE-bench 分数没有告诉你的真相
  67. 为何SWE-bench Verified 已无法衡量前沿编程能力

Share this post:

Previous Post
节省 Token 的大头在输入上下文,而非配置开关
Next Post
软路由三件套搭建零泄漏无广告网络