Skip to content
Dormon's Hideaway
Go back

Loop 工程的核心在判定与地基

来源:X @dashen_wang

Loop Engineering(循环工程)是 2026 年 AI 编程圈讨论较多的新词之一。它主张设计一个系统,让 agent 自己找活、自己干、自己检查、自己迭代到完成,而不是一条条写提示词 [8,35,43]。这个词由谷歌的 Addy Osmani 在 2026 年 6 月命名,核心定义是“设计一个系统来替代你 prompt agent” [8,13,15]。它传播很快:几天内有了名字,几周内有了课程和“取代提示词”的讨论,也招来了“不过是穿帽衫的 cron job”式的工程师反弹 [16]。但拆开看,这套被包装成新范式的机制,骨架是古老的闭环控制;真正稀缺并决定成败的是循环脚下的地基——“什么算对”。

一个 loop,就是一台恒温器

“自己迭代到完成”并不神秘。家里空调、暖气、电热水器上的恒温器就是同一件事:设一个目标(设定值),有执行机构干活,有传感器反馈状态,有控制器决定“低了开、到了停” [0]。所谓“AI 自己找活、自己干、自己检查、自己迭代到完成”,与这张表逐格对应:写下的意图和完成条件是设定值,写代码的 agent 是执行机构,判定“算不算完成”的独立小模型是传感器,决定要不要再来一轮的循环是控制器,磁盘上记着“干到哪了”的记忆是系统状态 [0]。一个 loop,就是闭环控制系统(closed-loop control)搬到了写代码这件事上 [0]

闭环反馈的历史远早于计算机。1788 年,瓦特应合伙人博尔顿的建议,把离心调速器装到蒸汽机上,用飞球的离心位移调节进汽阀,让蒸汽机自己稳住转速 [25,26,31,34]。严格说,这并非“人类第一个”自动反馈装置——离心调速器自 17 世纪惠更斯时代就用于风车和水车调速,瓦特只是把它改装到蒸汽机上 [25,31]。素材中 1885 年的电恒温器、1948 年维纳的《控制论》,乃至人体里血糖体温的自我调节,都是同一个结构 [0]

这张表五格里,设定值、传感器、控制器、状态四格,一百多年前就齐了;唯一真正变了的是执行机构那一格——从“专用”变成了“通用且便宜” [0]。一样东西变得极度充裕,价格就归零,与它互补的稀缺品则涨到天上:执行接近免费,“什么算对”——设定值和读它的传感器——成了唯一的稀缺 [0]。这正是“Loop Engineering”这个名字起错的地方:它把注意力引向那个最古老、最不重要的部件,而真正的活,在它脚下的地基里 [0]

五个零件,只有判定是活

任何一个 loop 剥到底,只有五个零件:意图(设定值)、执行(执行机构)、判定(传感器)、记忆(状态)、控制(控制器)[0];Osmani 的拆法也类似,五个组件加一个状态层 [8,13]。其中执行、控制、触发、记忆四样,已经内置在成熟工具里——Claude Code、Codex 等自带自动发现任务的 Automations、隔离并行的 worktree、沉淀知识的 Skills、跨会话的状态 [35,46]。记忆尤其朴素:素材说它“说穿了就是往一个文件里 append 几行字”;Anthropic 方案里对应的 claude-progress.txt,就是一个明文进度文件,记录完成哪些功能、当前在做什么、遇到什么问题,新会话不必重读全部历史,中断后断点续跑 [0,17,18]

真正替不了的那一个零件,是判定——那个读“算不算对”的传感器,以及它读的那条标准 [0]。前四个零件是通用的,任何 loop 长得都一样,所以能内置;而“什么算对”每个项目都不一样,必须由懂这件事的人亲手定 [0]。有工程实践文章直接写道“Loop Engineering 的核心不是’循环’,而是’验证’” [47],并非只有素材这么说。素材用法律 AI 公司 Harvey 做例证:它估值 110 亿美元 [1,2,3,5,6,7],做法不是训练新模型,而是整合 OpenAI、Anthropic、Google 的基础模型,配上专有法律数据与全球案例库 [2]——用素材的话说,改的是“笼子”不是“马” [0]。素材转述 Harvey 应用研究主任的结论:“当评判标准(rubric)质量高时,Agent 可以令人惊讶地沿着正确方向不断攀升”——你花多少心思定义“什么算好”,agent 就能走多远 [0]

判定这条线还有两条硬规矩。第一,干活的不能给自己打分 [0]。模型是评判自己作业最差的人——Anthropic 的 agent 设计指南明确写道,agent“倾向于自信地夸赞自己的工作”,哪怕质量平庸,这正是“生成与评估必须分离”的动机 [20]。工具层面已经如此:Claude Code 和 Codex 的 /goal 原语,每一轮之后由独立的小模型检查是否完成,写代码的 agent 不给自己打分 [9];让实现者自己判断是否合格,容易放过问题,独立验证者按验收标准检查才能形成制衡 [48]。第二,光独立还不够,判定必须能证伪 [0]。正面检验“能不能跑、过不过测试”,本质是找“看起来对了”的表面证据;成熟的安全审计派出的是一支从不同角度进攻的队伍,外加专门复现、证伪结论的角色 [0]。落到工程上就是“不要接受’我跑过测试了’的一面之词,要看退出码和实际输出”的零信任姿态 [45]。没有证据路径,就没有判定——判定器说“完成了”,它检查了什么、怎么检查的、检查到什么粒度,必须拿得出来 [0]

颗粒度:盲循环是采样不足的混叠

判定不是有没有的问题,是粗细的问题;颗粒度是业余 loop 和职业 loop 的分水岭 [0]。最常见的业余 loop:意图很大(“把整个用户中心模块重写一遍”),判定很粗(“能跑起来不报错就算完成”),于是它高效地、信誓旦旦地交付一颗定时炸弹——把余额字段从分算成元、删掉边界条件、重写掉并发保护,这些“能跑”统统看不见 [0]。素材管这叫盲循环(Blind Loop):它在高效地奔向一个没定义清楚的地方 [0]

loop 里有三种颗粒度,必须对齐:任务颗粒度(一轮改多大一块)、验证颗粒度(判定能把失败定位到多细)、记忆颗粒度(往磁盘里记多细)[0]。第一定律是:验证颗粒度必须细于任务颗粒度,否则就是一个动作幅度大于视力范围的系统 [0]。这与奈奎斯特采样定理同构——反馈的频率与精度必须高于变更的频率与幅度,否则 bug 会“混叠”进“完成”里,盲循环就是采样不足导致的混叠 [0]。两条路任选或并用:把任务切细——一次只实现一个函数、修一个 bug,而不是要一整块大输出,这也是 Osmani 自己工作流的经验 [44];把验证调细——而这第二条路的成本,决定了整件事的经济性 [0]

于是类型登场。类型系统能把验证颗粒度调到最细,且边际成本几乎为零:tsc 判一行和判一万行一样快、一样冷、不会拍马屁 [0]。一个 any 满天飞的代码库,等于给 loop 戴上眼罩,验证颗粒度被砸成零;精确的类型定义让 tsc —noEmit 当场指出第几行、哪个值、期望什么 [0]。行业里已有共识:把验收标准转成测试、lint、类型、schema、脚本、CI 和检查清单这类硬门禁,专门解决 AI 输出不可验证的问题 [36];软件开发恰好拥有一排机器可读的天然反馈——编译器、单元测试、集成测试、Lint、类型检查、性能测试、浏览器截图、安全扫描、CI/CD [47]

但类型不是万能传感器 [0]。tsc 看不见的至少有三层:语义关系(谁调用谁、改名会炸掉哪些文件)、运行时行为(真实请求的 payload、并发下的竞态)、人类视觉(布局歪了、暗色模式下字和背景同色)[0]。不同的 bug 住在不同的层,必须为每一层配上对应的传感器——职业 loop 的判定层是一张多层传感网,省掉哪一层,那一层的 bug 就集体变成隐形的盲循环 [0]。记忆的颗粒度同理:记太粗,重跑会忘细节;记太细,是噪声。正确的做法是存事件——谁、什么时候、做了什么、结果是什么——一条条 append 上去,只增不改 [0]。claude-progress.txt 就是这种逐阶段追加的明文流水 [17,18];OpenTSC 的事件流引擎(K3)同样规定 append-only、软删除、当前状态从事件推导 [24]

系统化:从戏法到器官

一个 loop 是戏法,一群 loop 互相喂、互相验、互相记,才是能自己运转的系统 [0]。组织怎么搭,控制论里有现成答案——可生存系统模型(VSM)指出,任何能活下去的系统都有五样东西:操作(干活的)、协调(别互相踩)、控制(验收的)、情报(发现该干嘛)、政策(定方向)[0]。越往下越没法外包:操作和协调工具白送,控制、情报、政策越来越是你一个人的事,政策那一行只能是你 [0]。这与外层循环的判断一致:agent 在内部循环里调查、实现、验证,人类拥有边界上的决策权——选择什么值得做、定义约束、判断证据是否足够、对结果负责,这是只有人能守住的一侧 [11,14];开发者的角色从监督每一步,变成验收成品 [41]

系统化之后有两件事必须盯住。一是判定标准会漂移——素材举自己量化的例子:三个月里“可靠信号”的门槛被悄悄放低了三次,每次都有理由,全程毫无察觉 [0]。治法是把校准写进系统:每一条预测强制带到期日、强制回填实际结果——OpenTSC 的 K4 反馈契约正是“预测带到期日+推理链” [0,24];睡梦中则让系统回放过去的判断、提炼模式,再用一批没见过的新任务验证——任何编入法典的判定都必须通过留出集验证,变更先 stage、验证通过再 adopt、adopt 前先备份 [0]。二是理解债(Comprehension Debt):loop 越快交付你没写的代码,你的理解和代码库现实之间的差距就越大 [8,9]。舒适的姿势是危险的——loop 自己跑时,人很容易停止有自己的意见,接受它给回的任何东西,Osmani 把这叫认知投降(cognitive surrender):带着判断力设计 loop 是加速器,为了逃避思考而设计 loop 则是毒药 [9,12,16]。两个人的 loop 可以一模一样,结果完全相反:一个用它在自己吃透的事上跑得更快,另一个用它逃避吃透 [9,12,15]。系统化的验收标准因此是“能复盘”——每条判断留推理痕迹、每条情报带来源可信度 [0];OpenTSC 的 K7 判断引擎每来新事件,就按 judgment_codex 更新相关实体的属性并留下推理痕迹 [24]

判定下沉:把“什么算对”压进最便宜的执法官

把上面串起来,loop 时代的核心工程动作就一句话:判定下沉(Judgment Descent)——把“什么算对”从最贵、最慢、最不可靠的层,一层层压到最便宜、最快、最确定的层 [0]。判断的优先级从低到高是类型检查器、测试、大模型裁判、人,能用前一个就不用后一个 [0]。软件开发恰好有一排现成的廉价执法官——编译器、类型检查、测试、lint、截图对比、CI/CD [36,47];那些压不下去的判断——品味、取舍、要不要做这件事——才留给人的脑子 [0]

与之配套的是作用域纪律:把笼子做小 [0]。素材举例,Vercel 给 v0 砍掉 80% 的工具后结果反而更好——能力更少,可靠性更强 [0];行业共识同样是权限按最小原则配置,接入代码仓库、数据库、生产环境时,不能让 agent 拥有超出任务所需的权限 [48]。对不可逆操作默认不执行、必须人工确认,是最基本的一条——素材提到 Antigravity 删掉一个希腊摄影师整个 D 盘、Replit 删掉客户生产数据库,缺的就是这一圈箍里最基本的常识 [0]。而“先声明,后使用”把这条纪律变成立法动作:loop 启动之前,就显式声明这一轮只准读哪些目录、写哪些文件、调哪些命令,没声明的,一律拒绝 [0]

立法层:开发劈成两半

素材把这一切收束成一个双关:两个 TSC——命令行里那条 TypeScript 类型检查器,和作者自己的理念(TSC,魂、判断本身)[0]。一个类型就是一条冻结的判断:interface Account { balance: Cents } 立的法,是“在我这个世界里,账户余额必须是分”;tsc 是那个不眠不休、一秒执行一万次、从不讲情面的执法官 [0]。类型是立法者思维的最小可执行版本,约束函数是它的数学版本——把任何输入钳制在 0 到 100 之间,任何输入经过它都被强制合法;两者合起来,就把“什么算对”从编译期和运行时两个时间维度同时焊死 [0]

于是开发这件事,沿着一条线劈成两半 [0]。执行层:把一个已经定义清楚、铺好类型、装好判定、对齐颗粒度的活,让 loop 跑出来——这一半便宜到“拉条狗都能按开始”,该尽情交出去 [0]。立法层:让“按开始”变得拉条狗都能干的那一切——盖地基、定“什么算对”、铺传感网、守住校准、还清理解债——这一半一寸都不能交 [0]。Osmani 那句“Build the loop. Stay the engineer.”(搭你的 loop,但继续当那个工程师)说的正是同一件事 [9,12]。素材把这套东西命名为“地基工程”(Foundation Engineering):所有的开发,从瓦特那台调速器到今天,从来都是打地基,AI 只是把地基之上的楼盖得快到拉条狗都能盖,于是地基本身第一次变成了唯一要紧的东西 [0]

至于三年后的预判——判定覆盖率会成为衡量代码质量与估值的新指标、反馈基础设施会成为一个新品类、会有一场被追溯到“盲循环”的暴雷、护城河会从模型搬到记忆——都是作者自己的赌注,留给时间验证 [0]。能带走的只有一句话:loop、地基和 tsc 各司其职,而那句“什么算对”——从来只能是你 [0]

原文更正:素材称瓦特1788年给蒸汽机装的离心调速器是“人类第一个”自动反馈装置,但离心调速器自17世纪(惠更斯)就用于风车与水车,瓦特只是把它改装到蒸汽机上。 [31]

参考来源

  1. 素材原文(见文首来源链接)
  2. Harvey:一家估值110亿美元的AI公司,正在重新定义全球法律行业_新浪财经_新浪网
  3. 法律 AI Harvey 值估飙升至 110 亿美元,加速全球扩张与商业化
  4. 法律AI新創Harvey獲巨額募資 估值衝破110億美元
  5. 哈维 AI 完成 7.6 亿美元融资 估值达 80 亿美元-安全KER - 安全资讯平台
  6. 法律AI创企Harvey获2.5亿美元融资,估值达110亿美元_文件_Vault_公司
  7. Harvey:一家估值110亿美元的AI公司,正在重新定义全球法律行业
  8. Legal AI startup Harvey raises $200 million at $11 billion …
  9. Loop Engineering:当你不再是那个敲 Prompt 的人-腾讯云开发者社区-腾讯云
  10. 張維峰 - Loop Engineering:不是你在 prompt agent,是你設計一個系統來 prompt…
  11. Designing Loops for Coding Agents | Addy Osmani posted on the topic | LinkedIn
  12. Own the Outer Loop - by Addy Osmani - Elevate
  13. Addy Osmani on X: “https://t.co/hIe0UX7z6T” / X
  14. Addy Osmani’s Loop Engineering: The 5 Components
  15. “The engineer of the future is the person who is able to choose what is worth doing.” — Addy Osmani
  16. Designing Loops - A Practitioner’s Short Field Guide
  17. Medium
  18. 从OpenAI、Anthropic 方案看AI 如何7×24 小时高质量执行任务
  19. Anthropic官方刚刚给出了一个最新解决方案:【让AI智能体 …
  20. Anthropic 現在在跑小規模A/B test 測試「把Claude Code 從 …
  21. Dive into Claude Code: The Design Space of Today’s and Future AI …
  22. Medium
  23. An update on recent Claude Code quality reports
  24. Medium
  25. tsc/whitepaper/OpenTSC-v1.0-壳-设计理念与技术实现.md at main · opentsc/tsc · GitHub
  26. 离心式调速器 - 维基百科
  27. 离心式调速器
  28. 离心调速器
  29. 历史上第一个Loop Engineering,诞生于1788年
  30. 瓦特对蒸汽机的六次重大改进 - 多见多闻 - 博客园
  31. 张继栋:瓦特的水壶与牛顿的苹果无稽之谈的误导
  32. Centrifugal governor - Wikipedia
  33. James Watt - Inventors Research Guide: Innovators, Inventions, and Technological Impact - Research Guides at Southern Adventist University
  34. A schematic Watt governor. James Watt introduced an early…
  35. James Watt | Biography, Inventions, Steam Engine, Significance, & Facts | Britannica
  36. 从 Prompt Engineering 到 Loop Engineering:AI 编程正在进入“闭环工程”时代-腾讯云开发者社区-腾讯云
  37. Vibe Coding 从入门到精通教程|AI 结对编程工作流
  38. 宝玉 on X: “OpenAI DevDay: 超越提示词的艺术:AI 编程的未来是“上下文工程” 从自动补全到自主智能体,我们如何教会 AI 真正理解代码” / X
  39. [PDF] AI+编程:生成式AI 带来颠覆式生产力跃迁AI + Programing
  40. 从AI辅助编程到AI-DLC:紫讯落地 AI 原生研发新范式的实践 | 亚马逊AWS官方博客
  41. Codex、Claude Code 等 AI 编程工具对软件工程的启发_人工智能_大龄码农有梦想-AI编程社区
  42. Loop Engineering: The Missing Layer That Makes AI Coding Agents Work in Production - Software Testing and Development Company
  43. What Is Loop Engineering? The New Meta for AI Coding Agents | MindStudio
  44. What Is Loop Engineering? | IBM
  45. My LLM coding workflow going into 2026 | by Addy Osmani - Medium
  46. Building effective rules for AI coding agents: 5 evolutions | Gadi Evron posted on the topic | LinkedIn
  47. how-to-vibecoding/03-进阶教程(二):多智能体分工+长任务治理.md at main · 1EchA/how-to-vibecoding · GitHub
  48. AI 编程正在进入“闭环工程”时代- 猿人谷
  49. Loop Engineering:让 Agent 自己完成开发、验证与迭代 - 全栈研发笔记
  50. AI 辅助 CI/CD - AI 辅助软件工程:实践与案例解析
  51. 什么是 CI/CD?
  52. AI Agent 开发技术完全学习指南(2026-07 基线版)part1_AIGC_jasonma1210-AI Agent技术社区

Share this post:

Previous Post
X创作者收款闭环:英国PayPal注册指南
Next Post
AI 写作去味:机理与操作方法