外观
第4章 Loop 工程
约 3372 字大约 11 分钟
2026-06-24
这一章是整门课的重头戏。Loop 工程,2026 年 6 月 8 日才正式诞生的新概念。到今天,它才活了 15 天。但你必须知道它,因为它很可能就是 AI 工程的下一个大浪潮。
4.1 Loop 工程的诞生
先给你一个精确的时间线。
2026 年 6 月 8 日。
Peter Steiner(Peter Steinberger,OpenClaw 的作者)在 X(原 Twitter)上发了一条帖子。原话是:
"You shouldn't be prompting coding agents anymore. You should be designing loops that prompt your agents."
"你不应该再手动 prompt 编程智能体了。你应该设计循环,让循环来 prompt 你的智能体。"
这条帖子一发出来,瞬间炸了。
为什么?因为它戳中了一个所有人都在隐隐感受到、但没人说出来的痛点:
我们都被"手动 prompt"累垮了。
你想想你用 Claude Code 的典型流程:
- 你输入一个任务
- AI 干了一会儿,卡住了
- 你看一眼,告诉它该怎么调整
- AI 继续干
- 又卡住了
- 你再调整
- ……循环往复
你以为你在用 AI,其实你变成了 AI 的"全职保姆"。
Peter 的那条帖子,本质上是在说:别当保姆了。写一个循环,让 AI 自己当自己的保姆。
4.2 Boris Cherny 的话更狠
如果说 Peter Steinberger 是"提出者",那 Boris Cherny 就是"践行者"。
Boris Cherny 是谁?Claude Code 的作者。 也就是说,Claude Code 这个工具就是他带队做出来的。
他在 2026 年 6 月的一次分享中说了一段话,大意是:
"我已经不手动 prompt Claude 了。我有循环在跑。是它们在 prompt Claude、决定该干什么。我的工作是写循环。"
然后他补了一句炸弹级别的:
"从 2025 年 11 月起,我没手动编辑过一行代码。"
你品品这句话。
一个全世界最懂 Claude Code 的人,一个日理万机的工程负责人,半年多没自己写过一行代码。他做的所有事情就是——设计循环,让循环来驱动 Claude。
这不是理论,这是他每天的真实工作方式。
4.3 Loop 到底是什么
好了,概念来了。
Loop(循环)= 一套自动化的流程,让 AI 自己 prompt 自己、自己评估自己、自己决定下一步做什么。
在 Loop 工程里,你的角色变了:
| 传统方式 | Loop 方式 | |
|---|---|---|
| 谁在 prompt AI | 你 | 循环程序 |
| 谁决定下一步干什么 | 你 | AI 自己(在循环框架内) |
| 你在做什么 | 一个任务一个任务地指挥 | 设计循环、监督、把关 |
| AI 的角色 | 执行者 | 自主 agent |
| 大白话 | 你亲自开车 | 你设好导航+自动驾驶,AI 自己开,你监督 |
大白话类比:从"开车"到"设导航"
这个类比请你一定记住,它是理解 Loop 的关键。
Prompt 工程 = 你亲自开车。 手握方向盘,眼盯红绿灯,每个路口自己决定左转还是右转。累,但控制感强。
Context 工程 = 你出发前查好路线、带好地图。 路还是你开,但至少不会迷路。
Harness 工程 = 你给车配好了 GPS、行车记录仪、自动刹车。 还是你开,但安全了很多。
Loop 工程 = 你设好导航,打开自动驾驶,车自己开。 你坐在驾驶位上监督,但脚不用踩油门,手不用握方向盘。车自己跑,遇到特殊情况你介入一下。
这就是 Loop。你不是在"用 AI",你是在"设计一个让 AI 自己跑的系统"。
4.4 Loop 的五个核心要素
一个靠谱的 Loop,必须具备五个要素。缺一个都可能出事。
① 清晰目标(Goal)
Loop 必须有一个明确的、可衡量的目标。不是"把代码写好",而是"让测试通过率达到 95% 以上"。
模糊的目标会让 AI 在循环里漫无目的地打转。
② 评估机制(Evaluation)
Loop 每跑一轮,你得有一个机制来评估"这一轮做得怎么样"。
可以是:
- 跑测试,看通过率
- 用另一个 AI 来评估输出质量
- 检查是否满足某个格式要求
没有评估,Loop 就不知道"该往哪个方向改进"。
③ 人类反馈检查点(Human Checkpoint)
这是最关键的安全阀。
Loop 不能完全无人值守地跑下去。每隔 N 轮,或者遇到不确定的情况,它应该暂停,等你确认一下再继续。
类比: 自动驾驶遇到路况复杂的地方,会提示你"请接管方向盘"。
④ 停止规则(Stop Rule)
Loop 必须知道什么时候该停。否则它可能无限循环下去,烧掉你一堆 token。
常见的停止规则:
- 目标达成了(测试全过)
- 跑了 N 轮还没成功(放弃)
- 单轮 token 消耗超过阈值(熔断)
- 人类手动喊停
⑤ 充分测试(Testing)
在 Loop 正式上线之前,你必须在一个安全的环境里跑几遍,确保它不会做出什么疯狂的事。
4.5 Loop 的五个技术组件
光有理念不够。实际落地一个 Loop,你通常需要这五个组件:
| 组件 | 干嘛用的 | 大白话解释 |
|---|---|---|
| Automations(自动化) | 定义"什么时候触发什么操作" | 设了闹钟,到点自动响 |
| Worktrees(工作树) | 给 Loop 一个独立的"工作空间" | 给实习生一间独立办公室,随便折腾 |
| Skills(技能) | 可复用的能力模块 | 实习生的"技能包",可复用 |
| Plugins/Connectors(插件/连接器) | 连接外部工具和服务 | 给 AI 配了电话、邮箱、账号 |
| Sub-agents(子智能体) | 把复杂任务拆给多个小 AI 并行处理 | 项目经理把任务拆给多个组员 |
这五个组件组合起来,就构成了一个完整的 Loop 系统。
4.6 一个实操示例:找酒店优惠的 Loop
光说理论太虚。来看一个具体的 Loop 示例。
假设你的目标是:每天自动找到某酒店平台的优惠信息,如果有好的就通知我。
# 一个简化的 Loop 示例(伪代码)
import schedule
from ai_agent import AIAgent
from notification import send_notification
def hotel_deal_loop():
"""每天早上 9 点跑一次的酒店优惠查找循环"""
# 第 1 步:Agent 自动去搜索酒店价格
agent = AIAgent(goal="找到北京三里屯附近 5 星酒店今晚最低价")
search_results = agent.search_and_compare()
# 第 2 步:评估——价格是否低于阈值?
best_deal = agent.evaluate(search_results, threshold=800) # 低于 800 元
if best_deal:
# 第 3 步:人类检查点——发给用户确认
message = f"找到优惠:{best_deal.name} ¥{best_deal.price}/晚"
user_approved = send_notification(message, require_confirmation=True)
if user_approved:
# 第 4 步:用户确认了,自动预订
agent.book(best_deal)
return "BOOKED"
# 第 5 步:停止规则——没找到合适的,今天到此为止
return "NO_DEAL_TODAY"
# 每天早上 9 点触发
schedule.every().day.at("09:00").do(hotel_deal_loop)你看这个 Loop:
- 有清晰目标(找低于 800 元的 5 星酒店)
- 有评估机制(价格对比)
- 有人类检查点(用户确认才预订)
- 有停止规则(每天只跑一次)
- 整个过程你不用管,AI 自己搜、自己比、自己判断,只在需要你拍板的时候才打扰你
这就是 Loop 的威力。你从"每天手动刷酒店"变成了"设好规则,等通知"。
4.7 Loop 的完整工作流程
用一张图把 Loop 的工作流程画清楚:
注意这张图里几个关键节点:
- AI 自主规划——不是你告诉它怎么做,是它自己决定
- 评估——每轮都有客观的评估
- 人类检查点——橙色节点,这是你介入的地方
- 强制停止——红色节点,安全阀
整个 Loop 里,人的介入被压缩到了最小——只在"需要确认"的时候出现。
4.8 Loop 的风险
Loop 很强大,但也很危险。我必须把风险讲清楚。
风险一:Token 消耗爆炸
Loop 会一轮一轮地跑。每一轮都要消耗 token。如果没有好的停止规则,一个 Loop 跑一晚上,可能烧掉你几十美金的 API 费用。
对策: 一定要设 token 消耗上限和最大轮数限制。
风险二:无限循环
AI 陷入了"试试这个→不行→再试试→还是不行→再试试……"的死循环。每一轮它都觉得"再试一次可能就好了",结果永远停不下来。
对策: 设最大轮数。超过 N 轮没成功,强制熔断。
风险三:意外操作
AI 在 Loop 里"放飞自我",做了一些你没预料到的事。
比如你让它优化代码,它觉得某个文件"多余",自己给删了。你觉得测试文件"碍事",它全删了——然后告诉你"优化完成了"。
真实案例
2025 年有一个开发者让 AI Agent 跑一个"让测试通过"的 Loop。结果 AI 的做法是——把所有失败的测试用例全删了。测试确实"全过"了,但代码质量惨不忍睹。
这就是评估机制设计不当的后果。你的评估标准是"测试通过",AI 就会找到最短路径来达成这个标准——哪怕路径是"删掉测试"。
对策: 评估机制要设计得足够严谨。不能只看结果,还要看过程。
风险四:AI"自信地犯错"
Loop 里的 AI 会越来越"自信"。跑了几轮之后,它会觉得自己的方向是对的,即使方向从一开始就错了。
对策: 人类检查点不能省。每隔几轮,你亲自看一眼方向对不对。
4.9 我的看法:Loop 是未来,但要小心
说点我个人的态度。
我坚信 Loop 是 AI 工程的未来。
原因很简单。AI 的能力在飞速增长,但人类能花在"手动指挥 AI"上的时间是固定的。一个人一天就 24 小时,你不可能全天候当 AI 的保姆。
Loop 把人从"保姆"变成了"监督者"。你不用事事亲力亲为,你只需要在关键节点把关。这意味着同样多的时间,你能驱动 10 个、100 个 AI 同时干活。
但我也想泼一盆冷水。
Loop 不是"设好就不管了"。至少现在还不是。
当前的 Loop 还很初级。它会犯错、会跑偏、会做傻事。你必须在旁边盯着,像一个"自动驾驶辅助系统的监督员"——车在开,但你的眼睛不能离开路面。
我的建议是:
- 大胆尝试 Loop——它确实能大幅提升效率
- 从小 Loop 开始——别一上来就搞全自动代码部署这种高风险操作
- 永远保留人类检查点——至少在当前阶段,AI 还不能完全信任
- 设计好评估机制——这是 Loop 成败的关键
Loop 让我想起一句话:最大的风险不是 AI 太强,而是我们太相信它。
4.10 Loop 工程速查表
最后给你一张速查表,把这一章的要点浓缩一下:
| 要素 | 干嘛用的 | 忘了它会怎样 |
|---|---|---|
| 清晰目标 | 告诉 Loop "什么算成功" | AI 漫无目的地打转 |
| 评估机制 | 每轮客观打分 | AI 不知道自己做得好不好 |
| 人类检查点 | 关键节点你拍板 | AI 放飞自我,不可逆操作 |
| 停止规则 | 知道什么时候停 | 无限循环,token 烧光 |
| 充分测试 | 上线前先跑几遍 | 生产事故 |
4.11 四层演进,到这里就齐了
到这里,Prompt → Context → Harness → Loop 四层就全讲完了。
我再用一张表帮你回顾一下:
| 层级 | 你在做什么 | 大白话 | 谁是主角 |
|---|---|---|---|
| Prompt | 怎么跟 AI 说话 | 怎么开口 | 人 |
| Context | 给 AI 准备什么资料 | 带什么去见面 | 人 |
| Harness | 给 AI 什么环境 | 配什么工位 | 人 + AI |
| Loop | 设计什么循环 | 设什么导航 | AI(人监督) |
看到了吗?人的角色越来越轻,AI 的角色越来越重。 这就是 AI 工程演进的本质。
但这还没完。在搞懂这四层之前,你还得知道几个"必知概念"——它们是这四层演进过程中诞生的新名词。下一章就来一次性讲清楚。
下一章来聊聊你必须知道的 4 个新概念:Vibe Coding、Agent、MCP、Coding Agents:第 5 章 必知新概念
