别急着搞 Loop——大多数人还没到需要它的阶段
最近半个月,我的信息流里全是 Loop Engineering。
每篇文章都在告诉你 Loop 多厉害:AI 自己跑、自己检查、自己迭代,你只要定个目标就能去睡觉了。有人用它六天重写了整个代码库,有人一个月自动提交 259 个 PR。
听起来像超能力。
但我自己跑了一个多月 Loop 之后,最大的感受是——大多数场景下你根本不该用它。
先说 Loop 是什么,三句话够了
Prompt 是一条指令,AI 答完就停。
Loop 是一个目标,AI 自己跑”执行→验证→修正”的循环,直到达标或触发退出条件。
核心区别:你从操作者变成了设计者。你不再一步步推着它走,而是定好规则让它自己转。
但问题是——
90% 的人搞 Loop 是在烧钱
我见过(也自己犯过)的典型错误:
错误 1:任务本身不重复
一次性的事情,一个好 prompt 就够了。花两小时设计一个 Loop 去做你下周不会再做的事,这叫工程自嗨。
Loop 的设置成本只有在重复执行中才能摊薄。如果一个任务每周出现不到一次,prompt 永远比 Loop 划算。
错误 2:没有硬性验证手段
这是最致命的。
Loop 的灵魂是验证环节——每轮迭代后,有东西能客观判断”这次做对了没”。测试通过没?类型对了没?lint 干净没?
如果你的任务没有这种硬判据——比如”帮我写一篇有洞见的文章”——那 Loop 里的验证环节就变成了 AI 给自己打分。
自检是无效检测。
我踩过这个坑:让 compile agent 自己判断是否需要更新已有 wiki 条目。它每次都说”不用”——因为”不更新”是最安全的答案,不会犯错。后来拆成独立的 checker agent,更新率从 5% 跳到 30%。
但如果你连一个独立 checker 都很难定义(因为”好”本身就是主观的),那这个任务就不适合 Loop。
错误 3:Agent 无法端到端完成
如果工作做到一半要停下来等你拍板,那它不是 Loop,是一个带暂停键的 prompt。
Loop 的价值在于你不在的时候它还在转。如果每轮都得把球传回给你,你省下的时间全花在了检查中间产物上。
错误 4:“完成”是品味判断
代码能不能跑,有客观答案。文章写得好不好,没有。
凡是最终需要人类品味来拍板的任务,Loop 只能帮你到 80 分,最后 20 分你还得自己来。而那 80 分,一个精心写的 prompt 通常也能到 70。
Loop 带来的边际提升,不值得它的复杂度和成本。
Loop 的成本是复利增长的
这是所有鼓吹 Loop 的文章都轻描淡写的部分。
每次迭代,Agent 要重新读整个上下文:目标、历史、上轮结果、失败记录。这堆东西每轮都在膨胀。
跑 10 轮的 Loop 不是花 10 个 prompt 的钱——是花 10 个越来越胖的 prompt 的钱。加上 Maker/Checker 双模型,账单再翻一倍。
一个中等任务单次跑完大约 5-20 万 tokens。但如果 Loop 迭代 6 轮才收敛,实际消耗可能是 80-150 万 tokens。
真正该看的指标:每个被接受的产出的成本。
如果你的 Loop 产出 10 个结果,你丢掉 6 个,你在做它本该替你省掉的审查工作。这不叫自动化,这叫用更贵的方式做同样的事。
“Ralph Wiggum Loop”——静默失败
还有一种更阴险的情况:Agent 跑了两轮就宣布完成,在半成品上退出。Loop 框架没有觉察到(因为 Agent 说了”done”),继续按节奏触发下一个周期。
结果:Loop 持续运行、持续计费,但什么有价值的都没产出。
静默失败是 Loop 最大的敌人——它不会崩溃报错,它会安静地花你的钱。
没有硬门控的 Loop,不是在帮你,是在骗你。
那什么时候该用?
四个条件必须同时满足:
| # | 条件 | 反面 |
|---|---|---|
| 1 | 每周至少重复一次 | 一次性任务 → 用 prompt |
| 2 | 有硬性验证手段能自动拒绝坏输出 | 品味判断 → 人类来 |
| 3 | Agent 能端到端完成,不需要中途交还 | 需要你拍板 → 不是 Loop |
| 4 | ”完成”有客观定义 | 主观标准 → prompt + 人工润色 |
少一条都不要搞。
满足这四条的典型场景:修复测试、lint cleanup、依赖升级、重复性代码迁移、定时数据处理。
不满足的典型场景:写文章、做设计决策、探索性研究、产品规划、任何需要”审美”的事。
我的建议:从不用 Loop 开始
逆向思考:
第一步,把你现在所有用 AI 做的事列出来。
第二步,划掉所有不满足四个条件的。
剩下的那 2-3 个,才是你真正值得投入 Loop 设计的地方。
对于剩下的大多数任务,一个写得好的 prompt(甚至一个 prompt 模板文件),效果已经够了。
如果你还是想试试
有一个零成本的方式可以感受 Loop 的思维模式。把这个粘贴到任何 LLM 里:
你将在循环中工作直到达标。
你将在循环中工作直到达标。
任务:[你要什么]
成功标准(严格):
- [标准 1]
- [标准 2]
- [标准 3]
每轮:
1. 执行——生产或改进
2. 验证——对每个标准打分 1-10,列出薄弱点
3. 决定——每项 8+ 输出"最终版本";否则修最弱项继续
规则:
- 8 分前不能说完成
- 不要问我问题
- 最多 5 轮
开始。
这不是 Loop——你还是触发者,关掉窗口它就消失。但它能让你体会到”给 AI 一个目标+验证标准,让它自己迭代”的效果。
体会到了,再决定要不要往真正的自动化方向走。
最后
Loop Engineering 是真实的技术演进,但它被过度营销了。
大部分人此刻需要的是:
- 一个好的 CLAUDE.md 让 Agent 理解你的项目
- 几个写得好的 prompt 模板
- 清楚什么该让 AI 做、什么不该
这些基本功没做好,Loop 只会帮你更快地把事情搞砸。