Clipping 微信公众号

[从Workflow到Loop系列1] 从自研到大厂默认——多智能体编排正在被一行命令磨平

by AI知识体系礼记 原文 ↗
Created: 2026-06-17

公众号名称:AI知识体系礼记

作者名称:AI知识体系礼记

发布时间:2026-06-17 18:35

「workflow 到 loop 拆解与实战」系列目录:01 综述·从自研到大厂默认(本文) · 02 五种 Multi-Agent 协调模式全拆解 · 03 一行 Bash 循环里的工程哲学 · 04 Context Window 是编排与循环的第一性约束 · 05 Cursor Subagent 完整使用手册 · 06 Claude Code Agent Teams + Outcomes + Dreaming · 07 OpenAI Codex /goal · 08 收官 · 我们的工作流如何被大厂磨平 + 自留地清单。


本文是 第 01 篇

00

18 小时无人值守,自主完成 18 个功能里的 14 个,总成本 4.20 美元。前 Anthropic 成员 @skirano 用 Codex /goal 给出的数据,跟 OpenAI 自己 5 月 GA 的 Goal Mode 同一个调子。

我们曾经花几周搭起来的多智能体编排框架,今天别人用一行命令 + 一个 subagent 文件 + 一段 Goal 文本就复刻了——而且往往跑得更稳。这不是夸张,这是 2026 年 5-6 月大厂工具集体下沉的结果。

01

一个刺痛的故事

去年我们团队做了一次「自研编排升级」:

① 把 LangGraph 的 supervisor 模式移植到我们的 IM agent 项目里

② 给 orchestrator 加了路由表、限流、重试、状态持久化

③ 设计了 7 类 worker,每个有自己的 system prompt + 工具白名单

④ 写了一份《编排协议 v2.3》,专门培训新人

上线的时候,我们觉得挺自豪——它能跑、能扩展、能在多渠道复用。

半年后,**Cursor 3.0(代号 Glass,4/2 发布)**搞了个 Agents Window,全屏把 Agent 当一等公民;Claude Code 在 5/6把多智能体编排搬进 Managed Agents,Lead Agent 能委派给 20 个 subagent;Codex 5/21把 /goal 升 GA,目标文本同时充当「起始指令 + 完成审计」。

再看一眼 Cursor 官方文档的三句话:

Subagents are specialized AI assistants that Cursor’s agent can delegate tasks to. Each subagent operates in its own context window, handles specific types of work, and returns its result to the parent agent. Use subagents to break down complex tasks, do work in parallel, and preserve context in the main conversation.

每个 subagent:独立上下文窗口专门化并行执行上下文隔离。——这不是我们半年前做的同一件事吗?只是它现在叫 .cursor/agents/verifier.md,几行 YAML frontmatter + 一个 prompt。

对照的不是概念,是 @skirano 给出的实证数字:18 小时,14/18 功能,$4.20

02

三厂同步发布:一个值得记录的窗口

2026 年 5-6 月,三家厂商像约好了一样,先后推出「目标自转 + 多智能体编排」能力:

时间厂商关键发布核心特性
4/2Cursor3.0 “Glass”Agents Window,Agent 作一等公民
4/24Cursor3.2/multitask,8 个并行 subagent,Git worktree 隔离
5/6AnthropicManaged Agents 多智能体编排Lead Agent + 最多 20 subagent,深度刻意限制 1 层
5/7Cursor/orchestrate与 Anthropic 同日对位,选中间路线
5/21OpenAIGoal Mode GA/goal 五子命令,跨会话持久化

这是一个 18 天三厂同步 的窗口。The New Stack 在 4/12 的观察很准:Cursor、Claude Code、Codex 正在合成同一个 stack

搜索热度也佐证:Futurum Research 统计,「multi-agent orchestration」在 2026-05 同比 +376%。该术语在 2026 年 5 月的位置,大致相当于 2024 年初的 RAG。

我们站在一个 范式转移的起点 上,而不是中段。

03

三类磨平现象

我把大厂工具对「自研编排」的磨平,归成三类。

① 模式磨平:五种协调模式 → 一键调用

Anthropic 官方博客系统总结了五种 multi-agent 协调模式:

Prompt chaining(链式)· Routing(路由)· Parallelization(并行)· Orchestrator-workers(编排)· Evaluator-optimizer(评估优化)

半年里这五种模式的实现成本是这样变化的:

模式2024 年实现成本2026 年下半年实现成本
Prompt chainingLangChain Expression Language + LCELClaude Code 计划模式(Shift+Tab 进入 plan mode)
Routing自定义分类器 + 路由表Subagent 文件(description: 字段 + 触发条件)
ParallelizationCelery + 自研任务图git worktree + /multitask 命令
Orchestrator-workersLangGraph supervisor + state schemaLead Agent + 20 个 subagent 委派(Anthropic Managed Agents)
Evaluator-optimizerReflexion / 自研 rubrics/goal + Stop hook + verification subagent

每一行右边那栏,都是 几行配置或一个文件

② 上下文磨平:context isolation → 默认行为

2025 年之前,谁要做上下文隔离,得自己折腾:

起一个 sub-process,把对话历史摘出来

维护 memory 文件,定期清理

写 trim/summary 脚本,避免 context window 撑爆

Cursor 把它做成默认:Explore / Bash / Browser 三个内置 subagent,不是「提供能力让你用」,而是「自动启用,你看不见但它在保护你的主 context」。

These three operations share common traits: they generate noisy intermediate output, benefit from specialized prompts and tools, and can consume significant context. Running them as subagents solves several problems.

Claude Code 同源思路:best practices 反复强调 context window is the most important resource to manage/goal、Stop hook、verification subagent 都是这个资源紧张下的产物。

③ 循环磨平:while-do 哲学 → 产品级体验

Geoffrey Huntley 在 ralph 那篇博客里那段著名的话:

while :; do cat PROMPT.md | claude-code ; done

Ralph 的本质是:一个 bash 循环 + 一个 prompt 文件 + 一个 plan 文件 + 一个 spec 目录

ralphable.com 把这个思路产品化成四步:

① Atomic Tasks · 拆成单个可验证的小任务

② Pass/Fail Criteria · 每个任务有明确成功条件

③ Progress Tracking · 进度在循环里累积

④ Loop Until Done · 全部 pass 才停

Codex /goal 是同一个思路的命令行化:你给一个目标,Codex 自己拆、自己跑、自己验证、直到目标达成;目标文本 同时充当起始指令与完成审计——不到目标不收手。

Ralph 是一行 bash,Codex /goal 是一个命令。我们曾经做的「任务编排引擎 + 自动验证」,今天等价于一句「达成 X 目标」。

04

三厂取舍:同一题面,三种答案

三厂对「multi-agent + 目标循环」这件事,给出了 清晰不同的设计取舍。这不是偶然,是哲学差异:

维度Codex /goalAnthropic Multi-agentCursor /orchestrate
目标深度无限制(子智能体可自我递归)刻意限制 1 层中间(子智能体可 spawn 子,但有限制)
编排模式目标驱动循环(Goal Loop)Orchestrator-Subagent 为主/multitask + Cloud Agents
并行度通过子 Agent 实现最多 20 个 subagent 并行最多 8 个并行 Agent
上下文隔离子 Agent 独立会话共享文件系统 + 独立上下文Git worktree 隔离
持久化跨会话持久化(soft-stop 自总结)Claude Console 云端持久Cloud Agents 长时间运行
成本模型API token($4.20/18 小时)API tokenCursor plan usage(绕开直接 API 计费)
适用场景长时无人值守企业级多 Agent 协作IDE 内实时编排
品牌调性激进,追求最大自主保守,企业安全可控中间,开发者体验优先

取舍差异不是「哪个更好」,是 不同的风险偏好。Anthropic 把 subagent 深度限制在 1 层,是为了防止递归失控;OpenAI 不限深度,是为了让 /goal 跑更长的任务链;Cursor 卡 8 个并行,是因为超过这个数开发者就看不过来了。

我们做自研编排的时候,其实也在做同样的取舍——只是没明说。这一节给 08 篇「自研 vs 大厂」对照打底。

05

我们做对了什么,做错了什么

做对的三件事

**① 把编排能力抽象出来。**这是基础设施,不是会被磨平的「功能」。我们的 supervisor 模式、worker 协议,这些骨架还有用,只是默认实现要被换掉。

**② 踩过的坑,大厂也在踩。**context overflow、tool hallucination、agent 间消息丢失,我们比他们早知道。这些经验在 08 篇会变成「自留地清单」。

**③ 业务适配层。**大厂工具默认行为覆盖不到我们 IM agent 的小细节(QQ/微信/钉钉协议、renwei 改稿步骤、renwei 写作心法),这些是护城河。

做错的三件事

**① 把「框架」当成了「产品」。**LangGraph 的图、AutoGen 的对话组,本质是脚手架,不是用户价值。AutoGen 本身已经在 2026 年 5 月被 Microsoft 转入 maintenance mode,被 Microsoft Agent Framework 接替——这件事本身就是框架产品化的失败注脚

**② 在 orchestration 层做了太多事情。**路由、限流、状态持久化,这些是大厂工具默认开的,自己造是重复造轮子。

**③ 低估了「工具默认行为」的覆盖速度。**2024 年还需要 AutoGen,2025 年 subagent 已经是 IDE 默认;2025 年还需要自研 Goal Loop,2026 年 Codex /goal 一个命令就够。

06

接下来:八篇拆解的预告

我把「编排」这件事拆成八篇来写。这个系列想回答三个问题:

· 是什么:大厂工具的 multi-agent / loop 默认行为究竟是什么?怎么用?

· 为什么:为什么这些模式现在成立?Context window、verifiable tasks、spec-driven development 各自扮演什么角色?

· 怎么落地:对我们自己的项目,哪些事该自己留,哪些事该让位给工具?

八篇如下(本篇是第 01 篇综述):

编号标题主要回答
01从自研到大厂默认(本文)现状、为什么发生、系列预告
02五种 Multi-Agent 协调模式全拆解是什么:五种模式 + 三厂取舍表
03一行 Bash 循环里的工程哲学:Ralph Loop是什么:Goal Loop 的最小完整形态
04Context Window 是编排与循环的第一性约束为什么:一切都回到 context
05Cursor Subagent 完整使用手册怎么用:三内置 + /multitask + Skills
06Claude Code Agent Teams + Outcomes + Dreaming怎么用:Managed Agents 编排 + 验证闭环
07OpenAI Codex /goal:目标驱动的 Agent 循环怎么用:五子命令 + 14/18 演示 + Goal 模板
08收官 · 我们的工作流如何被大厂磨平 + 自留地清单怎么落地:02-07 全部纳入对照 + OpenClaw 自留地

07

经典参考文章清单

大厂官方

Cursor Subagents 文档 · 三内置 subagent(Explore/Bash/Browser)+ 自定义协议
cursor.com/docs/subagents

Anthropic Multi-agent Coordination Patterns · 五种协调模式综述
claude.com/blog/multi-agent-coordination-patterns

Anthropic Building Effective Agents · workflows vs agents 的核心区分
anthropic.com/research/building-effective-agents

Claude Code Best Practices · context window + verification 闭环
code.claude.com/docs/en/best-practices

OpenAI Codex follow-goals · 目标驱动的 agent 循环
developers.openai.com/codex/use-cases/follow-goals

Goal Loop / Ralph 系

Geoffrey Huntley · Ralph Wiggum as a Software Engineer · Ralph loop 原始思想
ghuntley.com/ralph

Ralphable · Ralph loop 的产品化形态,skill.md 生成器
ralphable.com

经典综述 / 框架

Lilian Weng · LLM Powered Autonomous Agents · Planning/Memory/Tool use 三件套
lilianweng.github.io/posts/2023-06-23-agent

LangGraph Multi-Agent Workflows · multi-agent 三种连接方式
blog.langchain.com/langgraph-multi-agent-workflows

Microsoft AutoGen · 已进入 maintenance mode,被 Microsoft Agent Framework 接替
github.com/microsoft/autogen

案例 / 行业分析

@skirano Codex /goal 演示(X/Twitter 2026-06-16)· 18 小时 / 14/18 功能 / $4.20
x.com 上的公开演示,搜索 “@skirano codex goal”

Futurum Research · Cursor 3.2 as Agent Execution Runtime(2026-04-29)· 「multi-agent orchestration」搜索 +376%
futurumresearch.com

The New Stack · Cursor, Claude Code, Codex merging into one stack(2026-04-12)
thenewstack.io

FindSkill.ai · Multi-Agent Orchestration Plain-Language Guide(2026-05-21)
findskill.ai

延伸选型问题(08 篇展开)

Paseo(远程)/ OpenSwarm(本地)/ Symphony(团队) · Agent 编排的三种部署形态
08 篇展开讨论

下一篇预告
02 · 五种 Multi-Agent 协调模式全拆解 — 把 Anthropic 那篇博客的五种模式拆成实战可选项,每种配 Cursor/Codex/Claude 三厂怎么落地的对照案例。


内容效果不满意?点此反馈

输入关键词开始搜索