[从Workflow到Loop系列1] 从自研到大厂默认——多智能体编排正在被一行命令磨平
公众号名称:AI知识体系礼记
作者名称:AI知识体系礼记
发布时间:2026-06-17 18:35
「workflow 到 loop 拆解与实战」系列目录:01 综述·从自研到大厂默认(本文) · 02 五种 Multi-Agent 协调模式全拆解 · 03 一行 Bash 循环里的工程哲学 · 04 Context Window 是编排与循环的第一性约束 · 05 Cursor Subagent 完整使用手册 · 06 Claude Code Agent Teams + Outcomes + Dreaming · 07 OpenAI Codex /goal · 08 收官 · 我们的工作流如何被大厂磨平 + 自留地清单。
本文是 第 01 篇。
00
18 小时无人值守,自主完成 18 个功能里的 14 个,总成本 4.20 美元。前 Anthropic 成员 @skirano 用 Codex
/goal给出的数据,跟 OpenAI 自己 5 月 GA 的 Goal Mode 同一个调子。
我们曾经花几周搭起来的多智能体编排框架,今天别人用一行命令 + 一个 subagent 文件 + 一段 Goal 文本就复刻了——而且往往跑得更稳。这不是夸张,这是 2026 年 5-6 月大厂工具集体下沉的结果。
01
一个刺痛的故事
去年我们团队做了一次「自研编排升级」:
① 把 LangGraph 的 supervisor 模式移植到我们的 IM agent 项目里
② 给 orchestrator 加了路由表、限流、重试、状态持久化
③ 设计了 7 类 worker,每个有自己的 system prompt + 工具白名单
④ 写了一份《编排协议 v2.3》,专门培训新人
上线的时候,我们觉得挺自豪——它能跑、能扩展、能在多渠道复用。
半年后,**Cursor 3.0(代号 Glass,4/2 发布)**搞了个 Agents Window,全屏把 Agent 当一等公民;Claude Code 在 5/6把多智能体编排搬进 Managed Agents,Lead Agent 能委派给 20 个 subagent;Codex 5/21把 /goal 升 GA,目标文本同时充当「起始指令 + 完成审计」。
再看一眼 Cursor 官方文档的三句话:
Subagents are specialized AI assistants that Cursor’s agent can delegate tasks to. Each subagent operates in its own context window, handles specific types of work, and returns its result to the parent agent. Use subagents to break down complex tasks, do work in parallel, and preserve context in the main conversation.
每个 subagent:独立上下文窗口、专门化、并行执行、上下文隔离。——这不是我们半年前做的同一件事吗?只是它现在叫 .cursor/agents/verifier.md,几行 YAML frontmatter + 一个 prompt。
对照的不是概念,是 @skirano 给出的实证数字:18 小时,14/18 功能,$4.20。
02
三厂同步发布:一个值得记录的窗口
2026 年 5-6 月,三家厂商像约好了一样,先后推出「目标自转 + 多智能体编排」能力:
| 时间 | 厂商 | 关键发布 | 核心特性 |
|---|---|---|---|
| 4/2 | Cursor | 3.0 “Glass” | Agents Window,Agent 作一等公民 |
| 4/24 | Cursor | 3.2 | /multitask,8 个并行 subagent,Git worktree 隔离 |
| 5/6 | Anthropic | Managed Agents 多智能体编排 | Lead Agent + 最多 20 subagent,深度刻意限制 1 层 |
| 5/7 | Cursor | /orchestrate | 与 Anthropic 同日对位,选中间路线 |
| 5/21 | OpenAI | Goal Mode GA | /goal 五子命令,跨会话持久化 |
这是一个 18 天三厂同步 的窗口。The New Stack 在 4/12 的观察很准:Cursor、Claude Code、Codex 正在合成同一个 stack。
搜索热度也佐证:Futurum Research 统计,「multi-agent orchestration」在 2026-05 同比 +376%。该术语在 2026 年 5 月的位置,大致相当于 2024 年初的 RAG。
我们站在一个 范式转移的起点 上,而不是中段。
03
三类磨平现象
我把大厂工具对「自研编排」的磨平,归成三类。
① 模式磨平:五种协调模式 → 一键调用
Anthropic 官方博客系统总结了五种 multi-agent 协调模式:
Prompt chaining(链式)· Routing(路由)· Parallelization(并行)· Orchestrator-workers(编排)· Evaluator-optimizer(评估优化)
半年里这五种模式的实现成本是这样变化的:
| 模式 | 2024 年实现成本 | 2026 年下半年实现成本 |
|---|---|---|
| Prompt chaining | LangChain Expression Language + LCEL | Claude Code 计划模式(Shift+Tab 进入 plan mode) |
| Routing | 自定义分类器 + 路由表 | Subagent 文件(description: 字段 + 触发条件) |
| Parallelization | Celery + 自研任务图 | git worktree + /multitask 命令 |
| Orchestrator-workers | LangGraph supervisor + state schema | Lead Agent + 20 个 subagent 委派(Anthropic Managed Agents) |
| Evaluator-optimizer | Reflexion / 自研 rubrics | /goal + Stop hook + verification subagent |
每一行右边那栏,都是 几行配置或一个文件。
② 上下文磨平:context isolation → 默认行为
2025 年之前,谁要做上下文隔离,得自己折腾:
起一个 sub-process,把对话历史摘出来
维护 memory 文件,定期清理
写 trim/summary 脚本,避免 context window 撑爆
Cursor 把它做成默认:Explore / Bash / Browser 三个内置 subagent,不是「提供能力让你用」,而是「自动启用,你看不见但它在保护你的主 context」。
These three operations share common traits: they generate noisy intermediate output, benefit from specialized prompts and tools, and can consume significant context. Running them as subagents solves several problems.
Claude Code 同源思路:best practices 反复强调 context window is the most important resource to manage。/goal、Stop hook、verification subagent 都是这个资源紧张下的产物。
③ 循环磨平:while-do 哲学 → 产品级体验
Geoffrey Huntley 在 ralph 那篇博客里那段著名的话:
while :; do cat PROMPT.md | claude-code ; done
Ralph 的本质是:一个 bash 循环 + 一个 prompt 文件 + 一个 plan 文件 + 一个 spec 目录。
ralphable.com 把这个思路产品化成四步:
① Atomic Tasks · 拆成单个可验证的小任务
② Pass/Fail Criteria · 每个任务有明确成功条件
③ Progress Tracking · 进度在循环里累积
④ Loop Until Done · 全部 pass 才停
Codex /goal 是同一个思路的命令行化:你给一个目标,Codex 自己拆、自己跑、自己验证、直到目标达成;目标文本 同时充当起始指令与完成审计——不到目标不收手。
Ralph 是一行 bash,Codex
/goal是一个命令。我们曾经做的「任务编排引擎 + 自动验证」,今天等价于一句「达成 X 目标」。
04
三厂取舍:同一题面,三种答案
三厂对「multi-agent + 目标循环」这件事,给出了 清晰不同的设计取舍。这不是偶然,是哲学差异:
| 维度 | Codex /goal | Anthropic Multi-agent | Cursor /orchestrate |
|---|---|---|---|
| 目标深度 | 无限制(子智能体可自我递归) | 刻意限制 1 层 | 中间(子智能体可 spawn 子,但有限制) |
| 编排模式 | 目标驱动循环(Goal Loop) | Orchestrator-Subagent 为主 | /multitask + Cloud Agents |
| 并行度 | 通过子 Agent 实现 | 最多 20 个 subagent 并行 | 最多 8 个并行 Agent |
| 上下文隔离 | 子 Agent 独立会话 | 共享文件系统 + 独立上下文 | Git worktree 隔离 |
| 持久化 | 跨会话持久化(soft-stop 自总结) | Claude Console 云端持久 | Cloud Agents 长时间运行 |
| 成本模型 | API token($4.20/18 小时) | API token | Cursor plan usage(绕开直接 API 计费) |
| 适用场景 | 长时无人值守 | 企业级多 Agent 协作 | IDE 内实时编排 |
| 品牌调性 | 激进,追求最大自主 | 保守,企业安全可控 | 中间,开发者体验优先 |
取舍差异不是「哪个更好」,是 不同的风险偏好。Anthropic 把 subagent 深度限制在 1 层,是为了防止递归失控;OpenAI 不限深度,是为了让 /goal 跑更长的任务链;Cursor 卡 8 个并行,是因为超过这个数开发者就看不过来了。
我们做自研编排的时候,其实也在做同样的取舍——只是没明说。这一节给 08 篇「自研 vs 大厂」对照打底。
05
我们做对了什么,做错了什么
做对的三件事
**① 把编排能力抽象出来。**这是基础设施,不是会被磨平的「功能」。我们的 supervisor 模式、worker 协议,这些骨架还有用,只是默认实现要被换掉。
**② 踩过的坑,大厂也在踩。**context overflow、tool hallucination、agent 间消息丢失,我们比他们早知道。这些经验在 08 篇会变成「自留地清单」。
**③ 业务适配层。**大厂工具默认行为覆盖不到我们 IM agent 的小细节(QQ/微信/钉钉协议、renwei 改稿步骤、renwei 写作心法),这些是护城河。
做错的三件事
**① 把「框架」当成了「产品」。**LangGraph 的图、AutoGen 的对话组,本质是脚手架,不是用户价值。AutoGen 本身已经在 2026 年 5 月被 Microsoft 转入 maintenance mode,被 Microsoft Agent Framework 接替——这件事本身就是框架产品化的失败注脚。
**② 在 orchestration 层做了太多事情。**路由、限流、状态持久化,这些是大厂工具默认开的,自己造是重复造轮子。
**③ 低估了「工具默认行为」的覆盖速度。**2024 年还需要 AutoGen,2025 年 subagent 已经是 IDE 默认;2025 年还需要自研 Goal Loop,2026 年 Codex /goal 一个命令就够。
06
接下来:八篇拆解的预告
我把「编排」这件事拆成八篇来写。这个系列想回答三个问题:
· 是什么:大厂工具的 multi-agent / loop 默认行为究竟是什么?怎么用?
· 为什么:为什么这些模式现在成立?Context window、verifiable tasks、spec-driven development 各自扮演什么角色?
· 怎么落地:对我们自己的项目,哪些事该自己留,哪些事该让位给工具?
八篇如下(本篇是第 01 篇综述):
| 编号 | 标题 | 主要回答 |
|---|---|---|
| 01 | 从自研到大厂默认(本文) | 现状、为什么发生、系列预告 |
| 02 | 五种 Multi-Agent 协调模式全拆解 | 是什么:五种模式 + 三厂取舍表 |
| 03 | 一行 Bash 循环里的工程哲学:Ralph Loop | 是什么:Goal Loop 的最小完整形态 |
| 04 | Context Window 是编排与循环的第一性约束 | 为什么:一切都回到 context |
| 05 | Cursor Subagent 完整使用手册 | 怎么用:三内置 + /multitask + Skills |
| 06 | Claude Code Agent Teams + Outcomes + Dreaming | 怎么用:Managed Agents 编排 + 验证闭环 |
| 07 | OpenAI Codex /goal:目标驱动的 Agent 循环 | 怎么用:五子命令 + 14/18 演示 + Goal 模板 |
| 08 | 收官 · 我们的工作流如何被大厂磨平 + 自留地清单 | 怎么落地:02-07 全部纳入对照 + OpenClaw 自留地 |
07
经典参考文章清单
大厂官方
Cursor Subagents 文档 · 三内置 subagent(Explore/Bash/Browser)+ 自定义协议
cursor.com/docs/subagents
Anthropic Multi-agent Coordination Patterns · 五种协调模式综述
claude.com/blog/multi-agent-coordination-patterns
Anthropic Building Effective Agents · workflows vs agents 的核心区分
anthropic.com/research/building-effective-agents
Claude Code Best Practices · context window + verification 闭环
code.claude.com/docs/en/best-practices
OpenAI Codex follow-goals · 目标驱动的 agent 循环
developers.openai.com/codex/use-cases/follow-goals
Goal Loop / Ralph 系
Geoffrey Huntley · Ralph Wiggum as a Software Engineer · Ralph loop 原始思想
ghuntley.com/ralph
Ralphable · Ralph loop 的产品化形态,skill.md 生成器
ralphable.com
经典综述 / 框架
Lilian Weng · LLM Powered Autonomous Agents · Planning/Memory/Tool use 三件套
lilianweng.github.io/posts/2023-06-23-agent
LangGraph Multi-Agent Workflows · multi-agent 三种连接方式
blog.langchain.com/langgraph-multi-agent-workflows
Microsoft AutoGen · 已进入 maintenance mode,被 Microsoft Agent Framework 接替
github.com/microsoft/autogen
案例 / 行业分析
@skirano Codex /goal 演示(X/Twitter 2026-06-16)· 18 小时 / 14/18 功能 / $4.20
x.com 上的公开演示,搜索 “@skirano codex goal”
Futurum Research · Cursor 3.2 as Agent Execution Runtime(2026-04-29)· 「multi-agent orchestration」搜索 +376%
futurumresearch.com
The New Stack · Cursor, Claude Code, Codex merging into one stack(2026-04-12)
thenewstack.io
FindSkill.ai · Multi-Agent Orchestration Plain-Language Guide(2026-05-21)
findskill.ai
延伸选型问题(08 篇展开)
Paseo(远程)/ OpenSwarm(本地)/ Symphony(团队) · Agent 编排的三种部署形态
08 篇展开讨论
下一篇预告
02 · 五种 Multi-Agent 协调模式全拆解 — 把 Anthropic 那篇博客的五种模式拆成实战可选项,每种配 Cursor/Codex/Claude 三厂怎么落地的对照案例。
内容效果不满意?点此反馈