AI Agent 编程治理分水岭
TL;DR
这页是 AI Agent 编程治理主线的总纲:行业分水岭已经从“谁的模型更强”转向“谁能把规划、上下文、分工、验证、权限和组织接口做成稳定闭环”。它不替代各主题页,而是提供阅读路径和判断框架。[[raw/2026-04-28/白家杰/Harness Engineering实践心得:如何高效驾驭AI?.md|来源: Harness Engineering实践心得]] [[raw/2026-06-18/陈蛋黄/当我跨过沉沦的代码:Codex Goal 模式生存指南.md|来源: Goal 四要素]]
什么时候读这页
- 第一次进入 Agent 编程治理主线,需要总览阅读路线时。
- 要判断模型、工具、Skills、Harness、Loop、组织接口之间谁是主矛盾时。
- 要解释为什么长任务、验证、权限和团队流程正在超过单点代码生成的重要性时。
- 要找跨页入口,而不是深入某个单一工具或概念时。
核心判断
- 模型能力仍是地板,但治理层、验证层和工作流接口正在成为天花板。
- 分水岭不是“会不会写代码”,而是“能不能在可验证边界内持续推进真实任务”。
- Skills、Harness、Loop、Agent Teams、Workspace Agents、OPC/NPC 等看似分散的概念,本质都在回答同一个问题:如何组织智能体执行。
- 行业进入概念收敛和路线分歧并存阶段,矛盾不是噪音,而是判断技术路线的材料。
证据地图
| 主题 | 先读段落 | 代表来源 |
|---|---|---|
| 分水岭定义 | 为什么这是分水岭 | [[raw/2026-04-29/李泽宇的AI实验室/如何让Codex自主编码10小时,秘籍开源.md |
| 执行系统 | 从单工具到执行系统 | [[raw/2026-04-27/DracoVibeCoding/Claude Code开启团战模式!你必须要用起来的Agent teams!.md |
| Skills 治理 | Skills 与工作流开始接管治理层 | [[raw/2026-04-30/AI兴观点/你的AI编程搭档,有了-超能力-——Superpowers Skills技能库完全指南.md |
| Harness 平台化 | 上下文工程升级为 Harness / 平台工程 | [[raw/2026-05-08/Fox爱分享/同样的大模型,为什么别人的 Agent 能稳跑 6 小时,你的 30 分钟就-胡言乱语-?秘密就在 Harness 里。.md |
| 主要分歧 | 关键张力决定后续演化方向 | [[wiki/syntheses/矛盾与视角差异]] |
相关页面
- [[wiki/entities/Claude Code]]
- [[wiki/concepts/Skills、Agents 与工具设计]]
- [[wiki/concepts/上下文管理与 Harness Engineering]]
- [[wiki/concepts/Loop Engineering]]
- [[wiki/entities/Workspace Agents 与企业工作流]]
- [[wiki/syntheses/AI 创业与 OPC]]
待拆分观察
- 本页保持总纲定位,不继续吸收工具细节;Claude Code、Codex、OpenClaw 等产品细节应回到 entities。
关键张力后续若继续增长,应迁移到 [[wiki/syntheses/矛盾与视角差异]],这里只保留索引级摘要。- OPC/NPC 与组织接口材料可在 [[wiki/syntheses/AI 创业与 OPC]] 中继续展开。
AI Agent 编程这条主线的分水岭已经越来越清楚:过去更多在比模型单点能力,现在越来越在比谁能把规划、分工、上下文治理、验证回归和工作流接口组织成稳定系统。这张页不重复各主题页的长文,而是把 [[wiki/entities/Claude Code]]、[[wiki/concepts/Skills、Agents 与工具设计]]、[[wiki/concepts/Superpowers 与编程治理框架]]、[[wiki/concepts/上下文管理与 Harness Engineering]]、[[wiki/entities/Codex 与 Claude Code 集成]]、[[wiki/entities/Workspace Agents 与企业工作流]]、[[wiki/syntheses/AI 创业与 OPC]]、[[wiki/concepts/Loop Engineering]]、[[wiki/entities/Claude Code#Artifacts:从终端输出到实时交互页面(2026-06 新增)|Artifacts 与工作展示]] 和 [[wiki/syntheses/矛盾与视角差异]] 串成一个总入口。 [[raw/2026-04-28/白家杰/Harness Engineering实践心得:如何高效驾驭AI?.md|来源: Harness Engineering实践心得:如何高效驾驭AI?.md]] [[raw/2026-04-30/AI兴观点/你的AI编程搭档,有了-超能力-——Superpowers Skills技能库完全指南.md|来源: 你的AI编程搭档,有了-超能力-——Superpowers Skills技能库完全指南.md]] [[raw/2026-04-24/金色传说大聪明/OpenAI 发布 Workspace Agents,接替 GPTs.md|来源: OpenAI 发布 Workspace Agents]]
为什么这是分水岭
- 模型能力仍然重要,但越来越不足以解释复杂任务的真实产出;真正拉开差距的,是任务拆分、上下文卫生、验证回归和长时稳定性。 [[raw/2026-04-29/李泽宇的AI实验室/如何让Codex自主编码10小时,秘籍开源.md|来源: 如何让Codex自主编码10小时,秘籍开源.md]] [[raw/2026-04-27/金先森是朝鲜族阿/别问谁更强,GPT-5.5和Opus4.7综合对比.md|来源: 别问谁更强,GPT-5.5和Opus4.7综合对比.md]]
- 从 Claude Code 的 teams 到 Workspace Agents,再到 OPC 与多平台治理框架,产品路线虽然不同,但都在指向”更会组织执行”而不只是”更会回答”。 [[raw/2026-04-27/DracoVibeCoding/Claude Code开启团战模式!你必须要用起来的Agent teams!.md|来源: Claude Code开启团战模式!你必须要用起来的Agent teams!.md]] [[raw/2026-04-26/宇宙编辑部/YC 合伙人:如何利用 AI,从零建立一家出色的 OPC.md|来源: YC 合伙人:如何利用 AI,从零建立一家出色的 OPC.md]] [[raw/2026-04-29/金先森是朝鲜族阿/老金开源了个支持含CC、Codex等4个平台的编程治理框架.md|来源: 老金开源了个支持含CC、Codex等4个平台的编程治理框架.md]]
- 因此现在更值得追踪的,不只是模型榜单谁领先,而是谁先把治理层、组织接口和不断流工作流做成一等能力。 [[raw/2026-04-29/凤聆/Harness Engineering实践,做了一个平台让AI一晚上自动评测和优化你的系统.md|来源: Harness Engineering实践,做了一个平台让AI一晚上自动评测和优化你的系统.md]] [[raw/2026-04-30/问答/AI 工作流最重要的不是更自动化,而是不打断人.md|来源: AI 工作流最重要的不是更自动化,而是不打断人.md]]
- “Prompt -> Context -> Harness” 的三代演化框架,已在 2026-05 前被 Anthropic、OpenAI、LangChain 及多个国内团队独立确认,成为行业共识。同时多团队用数据验证了 Scaffolding > Model 的 ROI 铁律:投入 Harness 以 +50% 成本换取 +200% 提升,而追最新模型只能以 +300% 成本换来 +20%。 [[raw/2026-05-07/新安/Harness Engineering:耗时一周,我是如何将应用的AI Coding率提升至90%的.md|来源: 新安 AI Coding 率 90%]] [[raw/2026-05-08/Fox爱分享/同样的大模型,为什么别人的 Agent 能稳跑 6 小时,你的 30 分钟就-胡言乱语-?秘密就在 Harness 里。.md|来源: Fox LangChain 数据]] [[raw/2026-05-07/腾讯程序员/十年老技术开发的 AI Agent 探索之路.md|来源: 腾讯程序员 24h打工人]]
- Loop Engineering 被多源独立提出为第四次抽象跃迁(Prompt -> Context -> Harness -> Loop),进一步将治理边界从执行系统扩展到了循环设计与结果验证。争议同样存在:部分作者认为这是”新瓶装旧酒”,但这本身就是分水岭成熟期的典型信号——概念在收敛,分歧在深化。 [[raw/2026-06-19/梦朝思夕/万字长文 - 带你由浅入深了解 Loop Engineering:从手动 Prompt 到设计系统的跃迁.md|来源: 梦朝思夕 Loop Engineering]] [[raw/2026-06-17/Guide/面试官:‘你说你懂 Loop Engineering,那 Claude Code 的 -loop 和 -goal 区别是什么?‘.md|来源: Guide Loop 质疑]] [[raw/2026-06-19/AllenTang/一文搞懂Loop 工程、Harness 工程、FDE.md|来源: AllenTang 三层体系]]
- 平台竞争从编辑器延伸到浏览器。Anthropic Artifacts 与 OpenAI Sites 分别选择了无状态灵感画布和全栈 PaaS 两条路线,竞争维度从”谁写代码更好”转向”谁的工作展示与协作链路更完整”。 [[raw/2026-06-17/AI兴观点/Claude Code 推出新功能 Artifacts:AI 编程会话输出可以变成生动的交互页面,并能实时共享给团队.md|来源: AI兴观点 Artifacts]] [[raw/2026-06-17/ASI启示录(新智元)/Claude Code 让代码活了!终端里直接长出网页.md|来源: 新智元 Artifacts]]
- 企业流程摩擦取代模型能力成为更紧的约束:“AI 写代码 5 分钟,审批 5 天”揭示了组织治理层面的分水岭——Agent 跑得越快,被组织流程拖慢的副作用越明显。 [[raw/2026-06-19/AI知识体系礼记/OpenClaw 到 Hermes:这几个月.md|来源: AI知识体系礼记 流程摩擦]]
- Goal 模式方法论高度成熟:多源独立提炼出高度一致的最佳实践——具体结果 + 可验证标准 + 边界约束 + 停止条件,且跨平台链式工作流(Claude Code /plan + Codex /goal)开始出现。 [[raw/2026-06-18/陈蛋黄/当我跨过沉沦的代码:Codex Goal 模式生存指南.md|来源: 陈蛋黄 Goal 四要素]]
五条关键主线
1. 从单工具到执行系统
Claude Code、Codex 等路线正在从终端里的单点生成器,转向可分工、可委派、可持续推进任务的执行系统。Agent Teams、长时自主编码和角色化执行实践都说明:决定价值的不是单次回答漂不漂亮,而是复杂任务能不能持续推进。 [[raw/2026-04-27/DracoVibeCoding/Claude Code开启团战模式!你必须要用起来的Agent teams!.md|来源: Claude Code开启团战模式!你必须要用起来的Agent teams!.md]] [[raw/2026-04-29/李泽宇的AI实验室/如何让Codex自主编码10小时,秘籍开源.md|来源: 如何让Codex自主编码10小时,秘籍开源.md]]
延伸阅读:[[wiki/entities/Claude Code]]、[[wiki/entities/Codex 与 Claude Code 集成]]、[[wiki/entities/Workspace Agents 与企业工作流]]
2. Skills 与工作流开始接管治理层
Skills 不再只是加几个能力按钮,而是在把 brainstorming、计划、验证、回归、收尾这些工程步骤显式写进 agent 的工作流。Superpowers、Skill 设计总结和多平台治理框架共同说明:真正可复用的资产越来越像治理模板,而不是孤立 prompt。 [[raw/2026-04-30/AI兴观点/你的AI编程搭档,有了-超能力-——Superpowers Skills技能库完全指南.md|来源: 你的AI编程搭档,有了-超能力-——Superpowers Skills技能库完全指南.md]] [[raw/2026-04-27/青斧/工作流的 Skill 怎么写?从 7 个顶级 Skill 中提炼的模式与最佳实践.md|来源: 工作流的 Skill 怎么写?从 7 个顶级 Skill 中提炼的模式与最佳实践.md]] [[raw/2026-04-29/金先森是朝鲜族阿/老金开源了个支持含CC、Codex等4个平台的编程治理框架.md|来源: 老金开源了个支持含CC、Codex等4个平台的编程治理框架.md]]
SubAgent + Skills 已被多个独立作者验证为 1+1>2 的组合:Skills 提供 SOP/稳定性,SubAgent 提供上下文隔离;把”做事的 agent”和”评判的 agent”分离,被 Anthropic 称为”强力杠杆”。 [[raw/2026-05-09/潦草学者/用Kimi-K2+ClaudeCode做了条Agent流水线,节省90%的时间 - Subagent+Skills的最佳实践.md|来源: 潦草学者 Agent流水线]] [[raw/2026-05-09/宝玉/SubAgent 与 Skills:AI Agent 的两种扩展方式.md|来源: 宝玉 SubAgent 与 Skills]]
延伸阅读:[[wiki/concepts/Skills、Agents 与工具设计]]、[[wiki/concepts/Superpowers 与编程治理框架]]
3. 上下文工程升级为 Harness / 平台工程
上下文管理已经不只是省 token,而是在做污染控制、失败回滚、子代理隔离和长期任务续跑;Harness Engineering 则进一步把评测、优化、复盘推进到平台层。谁能把这些约束做成执行壳,谁就更可能得到稳定产出。 [[raw/2026-04-24/问答/Claude Code 上下文管理的 6 个动作,和它们背后的账本.md|来源: Claude Code 上下文管理的 6 个动作]] [[raw/2026-04-28/白家杰/Harness Engineering实践心得:如何高效驾驭AI?.md|来源: Harness Engineering实践心得:如何高效驾驭AI?.md]] [[raw/2026-04-29/凤聆/Harness Engineering实践,做了一个平台让AI一晚上自动评测和优化你的系统.md|来源: Harness Engineering实践,做了一个平台让AI一晚上自动评测和优化你的系统.md]]
LangChain 用同一模型(GPT-5.2-Codex)仅换 Harness,即将 Terminal Bench 2.0 从 52.8% 拉升到 66.5%(+13.7%),排名从 30+ 跃入 Top 5——瓶颈在基础设施而非模型能力。 [[raw/2026-05-08/Fox爱分享/同样的大模型,为什么别人的 Agent 能稳跑 6 小时,你的 30 分钟就-胡言乱语-?秘密就在 Harness 里。.md|来源: Fox LangChain 数据]]
延伸阅读:[[wiki/concepts/上下文管理与 Harness Engineering]]、[[wiki/concepts/Agent 原理、记忆与上下文工程]]
4. 平台竞争转向工作流接口争夺
Workspace Agents 面向组织流程,OPC 面向一人公司的经营执行面;看上去一个偏企业、一个偏个人,底层争的其实都是”谁更能接住真实工作流接口”。这也解释了为什么产品竞争会从聊天入口,逐渐转向执行链路和持续协作。 [[raw/2026-04-24/金色传说大聪明/OpenAI 发布 Workspace Agents,接替 GPTs.md|来源: OpenAI 发布 Workspace Agents,接替 GPTs.md]] [[raw/2026-04-26/宇宙编辑部/YC 合伙人:如何利用 AI,从零建立一家出色的 OPC.md|来源: YC 合伙人:如何利用 AI,从零建立一家出色的 OPC.md]] [[raw/2026-04-30/问答/AI 工作流最重要的不是更自动化,而是不打断人.md|来源: AI 工作流最重要的不是更自动化,而是不打断人.md]]
Artifacts vs Sites 的竞争将这条主线推到了新高度:Anthropic 的 Artifacts 是”对工作的一次记录”,OpenAI 的 Sites 是生成式 SaaS 生成器——战略分化表明平台竞争已经从聊天入口和编辑器延伸到了工作展示、同步和团队协作节点。 [[raw/2026-06-17/AI兴观点/Claude Code 推出新功能 Artifacts:AI 编程会话输出可以变成生动的交互页面,并能实时共享给团队.md|来源: AI兴观点 Artifacts]] [[raw/2026-06-17/ASI启示录(新智元)/Claude Code 让代码活了!终端里直接长出网页.md|来源: 新智元 Artifacts]]
延伸阅读:[[wiki/entities/Workspace Agents 与企业工作流]]、[[wiki/syntheses/AI 创业与 OPC]]、[[wiki/entities/OpenClaw 与多 Agent 编排]]、[[wiki/entities/Claude Code#Artifacts:从终端输出到实时交互页面(2026-06 新增)|Artifacts 与工作展示]]
5. 关键张力决定后续演化方向
当前最关键的两组张力是:一是”模型强弱 vs 任务形状”,二是”更自动化 vs 不打断人”。前者提醒我们别把榜单神化,后者提醒我们自动化必须服务于不断流,而不能把人踢出可控范围。 [[raw/2026-04-27/金先森是朝鲜族阿/别问谁更强,GPT-5.5和Opus4.7综合对比.md|来源: 别问谁更强,GPT-5.5和Opus4.7综合对比.md]] [[raw/2026-04-29/凤聆/Harness Engineering实践,做了一个平台让AI一晚上自动评测和优化你的系统.md|来源: Harness Engineering实践,做了一个平台让AI一晚上自动评测和优化你的系统.md]] [[raw/2026-04-30/问答/AI 工作流最重要的不是更自动化,而是不打断人.md|来源: AI 工作流最重要的不是更自动化,而是不打断人.md]]
2026-06 的输入进一步揭示了更深的张力:Loop vs Harness 的关系叙事分歧(第四次跃迁还是新瓶装旧酒)、多 Agent 架构分歧(单 Agent + 模块 vs 组织层级 CRD vs 单 Agent + Hooks + SubAgent)、以及工具追逐 vs 业务聚焦的根本性对立。这些张力不是需要解决的技术问题,而是分水岭阶段的特征信号——说明行业正在从”追求更多”转向”需要更少但更好”的阶段。 [[raw/2026-06-19/梦朝思夕/万字长文 - 带你由浅入深了解 Loop Engineering:从手动 Prompt 到设计系统的跃迁.md|来源: 梦朝思夕 Loop 张力]] [[raw/2026-06-19/AI知识体系礼记/OpenClaw 到 Hermes:这几个月.md|来源: AI知识体系礼记 工具追逐]] [[raw/2026-06-17/承吉/工单闭环从半天到 6 分钟:我们把 AI Agent 编进了组织架构.md|来源: 承吉 AgentTeams]]
延伸阅读:[[wiki/syntheses/矛盾与视角差异]]
6. Loop Engineering:第四次跃迁在加速收敛(2026-06 新增)
Loop Engineering 正在快速从概念走向完整框架。五要素模型(Automations/Worktrees/Skills/Connectors/Sub-agents + Memory)、六组件解剖(Goal/Tools/Context/Termination/Error Recovery/Guardrails)、四种常见模式(Retry/Plan-Execute-Verify/Explore-Narrow/Human-in-the-Loop)、三大风险(Comprehension Debt/Cognitive Surrender/Verification Gap)以及 Loop 成本公式(含 Thrashing 系数)的提出,意味着治理的焦点从”怎么写好 prompt”推进到了”怎么设计整个循环”。 [[raw/2026-06-19/梦朝思夕/万字长文 - 带你由浅入深了解 Loop Engineering:从手动 Prompt 到设计系统的跃迁.md|来源: 梦朝思夕 Loop]] [[raw/2026-06-19/AllenTang/一文搞懂Loop 工程、Harness 工程、FDE.md|来源: AllenTang Loop 解剖]]
矛盾:Harness Engineering 是 Agent 编程的最终范式(现有 wiki 将 Harness 定位为第三次跃迁的终点) vs Loop Engineering 是 Harness 之后的第四次跃迁——Harness 是脚本思维,Loop 是系统思维。同时 Loop Engineering 又被质疑为”新瓶装旧酒”。 [[raw/2026-06-19/梦朝思夕/万字长文 - 带你由浅入深了解 Loop Engineering:从手动 Prompt 到设计系统的跃迁.md|来源: 梦朝思夕 第四次跃迁]] [[raw/2026-06-17/Guide/面试官:‘你说你懂 Loop Engineering,那 Claude Code 的 -loop 和 -goal 区别是什么?‘.md|来源: Guide 旧酒质疑]]
延伸阅读:[[wiki/concepts/Loop Engineering]]
2026-05 Update: 新里程碑与共识确认
Managed Agents:从模型供应商到 Agent 基础设施商
2026-04-08,Anthropic 发布 Claude Managed Agents——云端托管的 Agent 平台,采用 Session/Harness/Sandbox 解耦的”元 Harness”设计。这标志着 Anthropic 的战略重心从”模型提供者”转向”Agent 基础设施商”,$0.08/session-hour 的定价开创了 token 之外的新收入模型。 [[raw/2026-05-07/金色传说大聪明/Anthropic 官方 Harness 发布:全面解读 Managed Agents.md|来源: Anthropic 官方 Harness 发布]]
知识才是真正的护城河
腾讯 AI 工程交付团队核心论点:工作流可替换,领域知识可沉淀、可累积、可复用。他们构建了 5 层 x 5 类 x 3 成熟度的知识架构,并将知识体系嵌入 Harness 工作流。关键句:“Skill、Agent、工具链会随模型迭代更新,但领域知识是永恒的。“——Harness 是手段,知识才是目的。 [[raw/2026-05-11/腾讯程序员/Harness不是目的,知识才是护城河 —— 一个AI工程交付团队的知识沉淀实践.md|来源: 腾讯程序员 知识沉淀]]
协议层加速收敛
MCP、A2A、Responses API——Agent 开发的竞争焦点正在从”框架混战”转向”协议 + 运行时 + 控制面”的竞争。这意味着开发者不需要在 LangChain/AutoGen/CrewAI 之间反复重写,选对协议与运行时即可保持工具的长期兼容性。 [[raw/2026-05-07/腾讯程序员/十年老技术开发的 AI Agent 探索之路.md|来源: 腾讯程序员 协议层]]
Software 3.0 与产品形态重构(2026-05 新增)
Karpathy 定义的 Software 3.0:不写代码也不训权重,写 prompt——模型本身就是可被自然语言编程的解释器。软件形态正在经历根本变化:
- 从 OPC(一人公司)到 NPC(零人公司):意图由系统根据目标函数自动生成,没有人在下达指令,Agent 网络围绕目标状态持续运行
- 产品的主要使用者从人转向 Agent:设计语言从交互转向协议,基本单位从功能转向任务,新产品骨架 = Skill + Memory + Eval
- 长尾需求被”即兴软件化”:AI 让模糊意图/开放结果/多步任务成为可能,软件的生产和消费方式被同时改写
[[raw/2026-05-03/金色传说大聪明/新时代,软件将如何变化?.md|来源: 新时代软件]] [[raw/2026-05-04/金色传说大聪明/产品的未来.md|来源: 产品的未来]] [[raw/2026-05-03/Datawhale/从 Vibe Coding 到 Agentic Engineering:Karpathy 说自己落后了!.md|来源: Karpathy Agentic Engineering]]
Skills 生态的 npm 时刻(2026-05-19 新增)
Matt Pocock Skills 仓库 78K+ 星(单日涨 3K+),Agent Skills 生态已形成四层格局:框架层(Superpowers) -> 库层(pocock) -> 基础设施层(agentmemory) -> 市场层(尚未出现)。类比 2015 年 npm——从”分享文本”到”分享制品”是关键转折。竞争判断:最先进入 Claude Code/Cursor 默认推荐列表的赢,不是最好的赢。Skills 不再只是工具扩展,正在成为新的软件分发渠道。 [[raw/2026-05-18/Jerry/Agent Skill 框架正在吃掉软件开发.md|来源: Agent Skill 框架]] [[raw/2026-05-18/AgentBuff/VibeCoding工程化实践之Matt Pocock Skills,软件工程经验的技能结晶.md|来源: Matt Pocock Skills]]
Harness 路线分化:三派之争(2026-05-19 新增)
OpenAI(单智能体深度自治,环境工程,100万行零人工)、Anthropic(Planner-Generator-Evaluator三智能体分离)、Cursor(动态上下文+数据驱动产品运营)——三家对”Agent可靠性从哪来”的回答完全不同。王云鹤更进一步提出Harness本质是”组合优化问题”和”AI灵魂之争”——谁控制Harness,谁就控制Agent生态入口。五个共同命题已形成行业共识,但实现路径正在分裂。 [[raw/2026-05-18/邵猛/Agent Harness Engineering 三重前沿实践:Codex、Claude Code、Cursor 如何让人类从编码者升为架构师.md|来源: 三重前沿]] [[raw/2026-05-18/机器之心/王云鹤眼中的Harness:复杂优化问题,AGI灵魂争夺之战.md|来源: 王云鹤Harness]]
Compute Allocator:人的新角色(2026-05-19 新增)
Anthropic CC团队工程师Thariq Shihipar提出:当Claude可以跑8小时花500美元时,人的角色从”编码者”升级为”计算资源分配者”——决定哪些目标值得花昂贵token、哪些未知问题要先问出来。这个定义统一了Karpathy的Agentic Engineering、Sam的”技术判断力值10倍”、Anthropic创始人手册的”AI Agent指挥家”三条线——共同指向人的不可替代性不在执行,在判断。 [[raw/2026-05-18/Capihom/Claude Code 工程师:为什么使用HTML文件作为AI规范丨How I AI.md|来源: HTML-as-Spec]]
Harness 衰变定律与演进边界(2026-05-22 新增)
李伟山提出的”Harness 衰变定律”统一了三派的共同演化方向:模型越强,Harness 应越薄。 工程师的核心能力从”堆约束”转为”动态判断哪些该加、哪些该撤”。三个代际的边界更加清晰:Prompt 回答”该说什么”、Context 回答”该知道什么”、Harness 回答”系统如何可靠运转”——三者层层包裹,不是替代关系。工程师的衡量标准随之切换:从”每天写多少行代码”到”Harness 能支撑多高的代码产出率”。 [[raw/2026-05-20/李伟山/从Prompt、Context到Harness,工程的三次进化与终局之战.md|来源: 李伟山 - 三次进化与终局之战]]
QQ 音乐 Harness 工业化体系(2026-05-22 新增)
黄欣欣团队给出了目前最完整的工业化 Harness 实践参考:代码产出 = AI 能力 × 上下文质量(乘法非加法)、五阶段主流程(初始化→需求定义→设计→开发→交付)+ 四道门禁(意图/方案/任务/环境)、三层知识体系(团队/框架/服务)+ 三仓联动(Harness/业务/IDL)、35 Commands + 34 Skills + 24 Agents 全部版本化管理、Self-Refinement 闭环(纠正→识别模式→沉淀到知识层→新会话/新模型/新人也受益)。自研定位精准:“不做补全、不做编辑器、不做模型网关,只补齐 L5 工程治理层。” [[raw/2026-05-21/黄欣欣/QQ音乐Harness Engineering实践.md|来源: 黄欣欣 - QQ音乐 Harness]]
Agent 四阶段与”代码首先是负债”(2026-05-22 新增)
飞樰梳理了 Agent 核心技术范式的四阶段演化:被动式 ReAct(2023)→ 工作流 Agent(2024)→ 自主 Agent(2025)→ 自进化 Agent(2026)。六大模块(Prompt/Planning/Memory/Tools/Workflow/Environment)各自经历了范式级变革,核心方法论统一为:“通过工程化手段构建确定性,以承载模型不确定性。” CLI 被定位为 Agent 时代的”天然工具”——对人类不友好但对模型是先天知识。 [[raw/2026-05-22/飞樰/Agent核心技术概念与范式发生了哪些演变以及背后的思考.md|来源: 飞樰 - Agent 范式演变]]
阿里云 CIO 的实践复盘从另一角度强化了上述判断:“代码一旦生产出来,首先是负债”(维护成本+复杂度),能否成为资产取决于业务价值。数据验证——前端人均代码量 3x、后端 2x;缺陷率前端降 30%、后端降 55%。AI 破解了两道经典难题:人月神话(加 Agent 无沟通损耗)和工程左移(AI 大幅降低左移成本)。同时提出”Agent 囤积症”警示:Skill 封装门槛下降意味着封装垃圾也容易,价值不在包装能力而在数据是否 Ready、工具是否成熟。 “定义清楚一个问题,问题可能就解决了 95%“,且权重正在逼近 99%。 [[raw/2026-05-22/阿里云开发者/代码一旦生产出来,首先是负债 —— 一个CIO 的AI效能实践复盘.md|来源: 阿里云开发者 - 代码负债]]
2026-06 Update
6. AI 软件工程范式革命(2026-06 新增)
王鹏程的系统性推演为分水岭论提供了工程史层面的深层支撑:软件工程过去五十年之所以是”最不彻底的工程”,是因为它没有完成其他工程门类”消耗能源把低阶智能固化成物理装置”这一步。大模型的突破性是工程史上第一次有了”认知引擎”。关键判断:Copilot 模式没有消除不确定性,它在循环放大——“Copilot 模式下你团队是在为 AI 厂商打工;AI 为中心模式下,你团队才能积累自己的工程资产。” [[raw/2026-06-02/王鹏程/AI软件工程范式革命的思考.md|来源: 王鹏程 认知引擎]]
六阶段演进路线补充了分水岭的量化标尺:阶段 3(“0 人工接管”)被定位为质变断点——从”AI 能写出代码”到”AI 不用人盯着”。 [[raw/2026-06-02/王鹏程/AI软件工程范式革命的思考.md|来源: 王鹏程 六阶段]]
7. 递归自我改进与迭代加速数据(2026-06 新增)
Anthropic 研究院《When AI builds itself》报告为分水岭论提供了量化支撑:模型能独立完成任务时长每 4 个月翻一番,Claude Opus 3(4 min)→ Sonnet 3.7(1.5h)→ Opus 4.6(12h)。这意味着治理分水岭的时间窗口正在收窄——从”人盯着 Agent”到”Agent 自主运行”的转型窗口可能以月为单位计算。 [[raw/2026-06-05/AI兴观点/半年52 倍优化,颠覆认知。Anthropic 报告里更值得深挖的信息是:AI 迭代飞轮已启动,甚至参与研究决策了。|来源: 递归自我改进]]
Fiona Fung(Claude Code 工程总监)的”瓶颈转移”理论为分水岭的第二阶段提供了指向性:写代码不是瓶颈了,验证、评审、安全才是。分水岭的后半程竞争不在模型能写多少代码,而在验证体系能承载多快的代码生成速度。[[raw/2026-06-03/数字生命卡兹克/分享Claude Code团队内部的5条工作原则,我觉得每一条都值得学习。.md|来源: 瓶颈转移]]
8. AI 原生组织三层次模型(2026-06 新增)
叶小钗的三层次模型(L1 工具辅助层→L2 流程嵌入层→L3 规则主导层)为分水岭论增加了组织治理维度。核心洞察:从 L2→L3 的难点不是信不信任而是愿不愿意——“老板首先不需要公平,需要可控。“这补充了一个被技术讨论长期忽视的维度:AI 治理的分水岭不仅是技术成熟度,更是组织愿不愿意被 AI 治理。 [[raw/2026-06-01/叶小钗/AI 原生不是技术升级,而是组织重构:高大上的背后,全是脏乱差.md|来源: 叶小钗 三层次]]
9. Loop Engineering:第四次跃迁与叙事分歧(2026-06 新增)
Loop Engineering 被多源独立提出,定位为 Prompt → Context → Harness → Loop 的第四次抽象跃迁。梦朝思夕的五要素模型(Automations/Worktrees/Skills/Connectors/Sub-agents + Memory)和六组件解剖(Goal/Tools/Context/Termination/Error Recovery/Guardrails)是目前最完整的理论框架。四种 Loop 模式(Retry/Plan-Execute-Verify/Explore-Narrow/Human-in-the-Loop)各有核心陷阱,而三大风险(Comprehension Debt/Cognitive Surrender/Verification Gap)指出了 Agent 自主运行的根本性隐患。 [[raw/2026-06-19/梦朝思夕/万字长文 - 带你由浅入深了解 Loop Engineering:从手动 Prompt 到设计系统的跃迁.md|来源: 梦朝思夕 Loop 框架]] [[raw/2026-06-19/AllenTang/一文搞懂Loop 工程、Harness 工程、FDE.md|来源: AllenTang Loop 解剖]]
AllenTang 为 FDE(Forward Deployed Engineer)给出了精确定义——同时懂 Loop 工程 + Harness 工程 + Eval 工程 + 业务判断,三工程能力加上业务判断构成了一个全新岗位的能力模型。他还指出停止条件是 Agent 最被忽视的工程问题:停太早、停不下来、停在错误的地方。 [[raw/2026-06-19/AllenTang/一文搞懂Loop 工程、Harness 工程、FDE.md|来源: AllenTang FDE 定义]]
Guide 对 /loop 和 /goal 的实操区分具有独立价值:/loop = 时间驱动轮询(下次什么时候醒),/goal = 目标驱动完成(什么时候算做完),本质上是”频率驱动的外层调度循环”和”条件驱动的内层执行循环”的区分。他提出的 L0-L4 安全权限分级框架(只读摘要→本地复现→草稿修复→创建 PR→自动合并)是 Agent 治理的实用工具。 [[raw/2026-06-17/Guide/面试官:‘你说你懂 Loop Engineering,那 Claude Code 的 -loop 和 -goal 区别是什么?‘.md|来源: Guide Loop/Goal 区分]] [[raw/2026-06-18/陈蛋黄/当我跨过沉沦的代码:Codex Goal 模式生存指南.md|来源: 陈蛋黄 Goal 四要素]]
LangGraph 的底层原理为 Loop 提供了状态机实现视角:它将 LLM 调用从线性链转化为状态机,State 为数据快照、Node 为执行动作、Edge 为路由逻辑,Reducer 机制通过部分更新而非全量替换实现了可恢复性。编译期验证、邻接表预计算、Fan-out/Fan-in 并行调度等工程细节支撑了 Loop 的可靠实现。 [[raw/2026-06-20/Jameszyh/LangGraph 底层原理:它是怎么把 LLM 变成一台状态机的.md|来源: Jameszyh LangGraph 状态机]]
10. Artifacts vs Sites:平台竞争从编辑器到浏览器(2026-06 新增)
Anthropic 推出 Artifacts,将 AI 编程会话输出转化为可视化交互页面,核心洞察是”既然 AI 做了活,那就让 AI 也负责把这个活讲清楚”。Artifacts 是自包含的 HTML 页面(CSP 锁死外部请求、零部署成本),官方定位为”对工作的一次记录,而不是一个应用程序”。它解决的信息同步问题是传统模式 40% 的时间花在信息同步上。 [[raw/2026-06-17/AI兴观点/Claude Code 推出新功能 Artifacts:AI 编程会话输出可以变成生动的交互页面,并能实时共享给团队.md|来源: AI兴观点 Artifacts]] [[raw/2026-06-17/ASI启示录(新智元)/Claude Code 让代码活了!终端里直接长出网页.md|来源: 新智元 Artifacts]]
这与 OpenAI Sites(生成式 PaaS——生成的项目直接跑在 Cloudflare Workers 上)形成了清晰的战略分化:Anthropic 锚定无状态高安全性技术工作流,OpenAI 走全栈应用开发平台路线。竞争维度已经从编辑器拉到了浏览器——Copilot 还在 VSCode 里打转,Anthropic 已经拓展到浏览器。开发者的交付物不再只是代码:PR 产出不只是 diff 还有交互演示页。 [[raw/2026-06-17/ASI启示录(新智元)/Claude Code 让代码活了!终端里直接长出网页.md|来源: 新智元 Sites vs Artifacts]]
11. CLAUDE.md 治理共识与配置体系分层(2026-06 新增)
2026-06 的多源输入在 CLAUDE.md 治理上达成了高度一致的共识:CLAUDE.md 会自然膨胀,核心不是写多好而是判断什么该删、什么该下沉为 skill、什么该上提到全局层。
关键的配置体系认知框架正在收敛为七种机制的层次化理解:
- 上下文成本意识分层:CLAUDE.md / Rules / Skills / Subagents / Hooks / Output Styles / append-system-prompt 在加载时机、压缩行为、权重上各有差异
- 提示词说服 vs 确定性执行:CLAUDE.md / Rules / Skills 依赖模型理解和遵从,Hooks + Permissions 走代码执行路径——“告诉 AI 怎么做”和”让事情自动发生”是两件不同的事
- 机制选择决策框架:事实放 CLAUDE.md / 局部约束放路径限定的 Rules / 流程放 Skills / 隔离任务放 Subagents / 确定性行为放 Hooks / 角色定位放 Output Styles
- 分层治理原则:全局级(~/.claude/)、项目级(./CLAUDE.md)、子目录级(.claude/rules/)、skill 级各管一段互不串味
Skill 的本质在此轮摄入中被进一步澄清:它不是提示词——它是 .skll 文件(批量文件按约定结构打包改后缀)。这个认识纠正了很多使用者的误解。 [[raw/2026-06-17/金色传说大聪明/深入理解 Claude Code:从 CLAUDE.md 到 Hooks、Skills、Subagents.md|来源: 金色传说大聪明 CC 配置体系]] [[raw/2026-06-17/尼恩(技术自由圈)/阿里面试官:如何设计工业级 Skills 进化体系?一个工业级技能 Infra 底座如何设计?.md|来源: 尼恩 Skill 工业化]]
12. 多 Agent 架构分歧与组织治理现实(2026-06 新增)
2026-06 的输入揭示了多 Agent 架构的根本性分歧,三种哲学路线同时存在、互相竞争,且各有生产验证:
- 单 Agent + 能力模块(Hermes/得物):选择单 Agent 编排 + 多能力模块 + 看板确认点,刻意不用多 Agent 集群。优势是简化运维和治理。 [[raw/2026-06-17/小诘、博温/从埋点需求到规则资产:Hermes Agent 重构得物数仓工作流.md|来源: 得物 Hermes 单 Agent]]
- 组织层级 CRD(AgentTeams/HiClaw):将组织结构映射为 CRD(Manager→Team→Worker→Human),类比 Kubernetes。Agent 运行时(OpenClaw/CoPaw)与编排平面分离,Human 作为一等公民与 Agent 共享 Matrix 房间,15 Agents × 4 场景将告警到解决周期从半天缩短到 6 分钟。 [[raw/2026-06-17/承吉/工单闭环从半天到 6 分钟:我们把 AI Agent 编进了组织架构.md|来源: 承吉 AgentTeams]]
- 单 Agent + Hooks + 专门 SubAgent(扶苏/传统实践):通过 PreToolUse/PostToolUse 精确控制行为,出问题时人类在 2 分钟内接管。 [[raw/2026-06-17/金色传说大聪明/深入理解 Claude Code:从 CLAUDE.md 到 Hooks、Skills、Subagents.md|来源: 金色传说大聪明 SubAgent]]
三种路线没有收敛迹象,说明”it depends”而非”one best way”才是正确答案。但一个更强的共识正在浮现:Human-in-the-Loop 必须是一等设计要素。Hermes 的三道门(事实来源门/演练门/责任门)、AgentTeams 的 L1/L2/L3 权限模型、扶苏的”30 分钟挣扎不成就人接管”规则,都指向同一个结论——目标是定义人类何时必须介入,而非消除人类。 [[raw/2026-06-17/小诘、博温/从埋点需求到规则资产:Hermes Agent 重构得物数仓工作流.md|来源: 得物 Hermes 三道门]] [[raw/2026-06-17/承吉/工单闭环从半天到 6 分钟:我们把 AI Agent 编进了组织架构.md|来源: 承吉 HITL 模型]]
矛盾:Multi-agent systems should minimize human involvement (trend toward full automation in several wiki sources) vs Human is a first-class citizen in multi-agent systems — Agents and Humans must share the same communication rooms with explicit permission levels [[raw/2026-06-17/承吉/工单闭环从半天到 6 分钟:我们把 AI Agent 编进了组织架构.md|来源: AgentTeams Human CRD]] [[raw/2026-06-17/小诘、博温/从埋点需求到规则资产:Hermes Agent 重构得物数仓工作流.md|来源: Hermes 三道门]]
与此同时,企业流程摩擦被揭示为比 AI 能力更紧的约束:OpenClaw→Hermes 复盘指出”AI 写代码 5 分钟,但需要 5 天通过 7 道审批”、“Tech 团队 80% 采纳 AI,Business 团队 0%“,并提出五把手术刀(停止订阅 AI 新闻/从 OKR 中删除 AI/给业务团队也配 AI 工具/砍掉一半审批/接受追不完工具)。[[raw/2026-06-19/AI知识体系礼记/OpenClaw 到 Hermes:这几个月.md|来源: AI知识体系礼记 反内卷五刀]]
矛盾:Adopting new AI tools progressively improves engineering productivity (wiki’s core premise) vs Tool-chasing is counterproductive — companies adopt all new tools and use none well, creating a vicious cycle [[raw/2026-06-19/AI知识体系礼记/OpenClaw 到 Hermes:这几个月.md|来源: AI知识体系礼记 工具追逐]]
13. 知识资产化与自进化螺旋(2026-06 新增)
多源独立收敛到同一个方向:知识正在被当作代码一样以版本化、可组合、可执行的方式对待。扶苏的 Skill 规则沉淀、Hermes 的规则资产化(判断什么值得记——可复用的模式落为规则包,治理类进长期记忆)、技术自由圈的四层自进化 Infra 架构(轨迹感知层→技能蒸馏层→技能进化层 GEPA→技能治理层)构成了从理念到工程的完整路径。 [[raw/2026-06-17/小诘、博温/从埋点需求到规则资产:Hermes Agent 重构得物数仓工作流.md|来源: Hermes 规则资产化]] [[raw/2026-06-17/尼恩(技术自由圈)/阿里面试官:如何设计工业级 Skills 进化体系?一个工业级技能 Infra 底座如何设计?.md|来源: 尼恩 GEPA]]
技术自由圈的 GEPA 闭环(Generate-Evaluate-Patch-Audit)是自进化的核心机制,脏计数器(Dirty Counter)按有效工具调用次数而非对话轮数触发复盘,影子 Agent 六维舱壁隔离,缓存继承实现约 26% 端到端算力成本降低。边车文件模式(Sidecar Pattern)将 Skill 内容与使用统计分离存储,四状态双向可逆状态机(active/stale/archived/pinned)管理技能生命周期。 [[raw/2026-06-17/尼恩(技术自由圈)/阿里面试官:如何设计工业级 Skills 进化体系?一个工业级技能 Infra 底座如何设计?.md|来源: 尼恩 GEPA 细节]]
14. Goal 模式方法论成熟与验证信任危机(2026-06 新增)
Goal 模式在 2026-06 达到了方法论的成熟期。多源独立提炼出高度一致的四大要素(目标/证据/边界/停止条件),其中”相同 blocker 连续出现两次就停”是跨源确认的实用战术规则。Codex /goal + Claude Code /plan 的跨平台链式工作流(先用 CC 分析方案,再用 Codex 长线执行)标志着工具之间从竞争走向互补。执行前要求模式(先读文档和 AGENTS.md 并输出理解后才能执行)提供了防止误解的预检机制。 [[raw/2026-06-18/陈蛋黄/当我跨过沉沦的代码:Codex Goal 模式生存指南.md|来源: 陈蛋黄 Goal 实战]]
一个重要的警示信号:验证信任危机。多项来源指出 AI 自称完成的不可信——吴师兄的黑屏被教育事件(20 次通过里 7 次假通过)、陈蛋黄的 GitHub 社区报告的 audit 退化问题(agent 随上下文压缩弱化原始 Goal 中的 audit 要求)、AI 沃茨的渲染静默缺陷(0 fail 全绿仍有 bug)。共识是必须建立独立的验证手段:真实浏览器验证、连续运行测试、最终重新读文档审计、多模型共识判定。 [[raw/2026-06-18/陈蛋黄/当我跨过沉沦的代码:Codex Goal 模式生存指南.md|来源: 陈蛋黄 验证危机]] [[raw/2026-06-17/金色传说大聪明/深入理解 Claude Code:从 CLAUDE.md 到 Hooks、Skills、Subagents.md|来源: 金色传说大聪明 验证闭环]]
15. 上下文窗口作为根本约束与任务原子化(2026-06 新增)
多源输入进一步确认了上下文窗口是所有 Agent 治理的根本瓶颈。Jameszyh 的任务原子化理论提出了三个核心标准:上下文占用 < 50%(30% 推理 + 20% 输出生成)、显式依赖闭合、二值完成标准,以及四个反模式(伪原子化/上下文不隔离/并行无共享真源/忽略依赖)。微服务同构类比(服务边界 = 任务边界,API = 文件系统,编排器 = K8s)为任务分解提供了结构化的参照。 [[raw/2026-06-20/Jameszyh/核心原理(三):任务原子化为可独立执行的单元.md|来源: Jameszyh 任务原子化]]
LangGraph 的任务状态机映射(State=LLM 上下文、Node=LLM 调用/工具、Edge=条件路由)和任务原子化的微服务类比从不同角度说明:Agent 编程正在从”单核顺序执行”向”多核并行架构”迁移,理论上可以线性扩展。AgentTeams 的生产数据(告警到解决从半天到 6 分钟)从另一角度验证了这条路径的可行性。 [[raw/2026-06-20/Jameszyh/LangGraph 底层原理:它是怎么把 LLM 变成一台状态机的.md|来源: Jameszyh LangGraph 状态机]] [[raw/2026-06-17/承吉/工单闭环从半天到 6 分钟:我们把 AI Agent 编进了组织架构.md|来源: 承吉 6 分钟]]
本页关注的后续方向
- Agent 基础设施竞争(Managed Agents vs Workspace Agents vs Codex Desktop)
- 知识沉淀方法论如何产品化
- 协议标准化对治理框架的影响
- 从”个人编码助手”到”组织级 Agent 平台”的迁移路径
- 从 OPC 到 NPC:Agent 自主运营的经济模型
- Loop Engineering 的实践验证与框架收敛
- Artifacts vs Sites 的竞争演变与工作展示范式
- Multi-Agent 架构的实践选择指南
- CLAUDE.md 治理工具化与膨胀检测
2026-07 更新:分水岭从工具能力转向治理闭环
新增 148 篇来源进一步确认:AI Agent 编程的分水岭已经不是”哪个工具更会写代码”,而是谁能把任务契约、上下文、权限、验证、预算、记忆、可观测性和组织责任串成闭环。工具更新很快,但稳定的稀缺资源是判断力、验证证据、上下文基础设施和清理能力。[[raw/2026-06-25/郑玄/90% 的代码交给 AI 之后,字节发现了一个反常识的真相.md|来源: 90% AI 代码反常识]] [[raw/2026-07-02/李伟山/Loop Engineering又是啥?一文讲清企业Agent落地的四层工程进化论.md|来源: 四层工程进化]] [[raw/2026-07-02/互联网项目团队/未来,什么才是 AI“正确的使用方式”.md|来源: AI 正确使用方式]]
四层工程进化论补上了总纲视角:工具使用只是第一层,规则/上下文是第二层,Loop/Harness 是第三层,组织级责任和业务闭环才是第四层。很多团队卡住,不是因为没用最新 Agent,而是只完成了工具替换,没有建立验证和责任系统。[[raw/2026-07-02/李伟山/Loop Engineering又是啥?一文讲清企业Agent落地的四层工程进化论.md|来源: 四层工程进化]]
生产率指标被修正:“90% 代码由 AI 写”不等于 90% 产能提升。端到端吞吐还受需求澄清、架构决策、review、测试、上线、回滚、组织流程约束。代码贡献率是局部指标,不能替代交付周期和质量指标。[[raw/2026-06-25/郑玄/90% 的代码交给 AI 之后,字节发现了一个反常识的真相.md|来源: 字节 AI Coding 反常识]] [[raw/2026-06-23/Felix/AI 把写代码从 3 天压到半天,整个项目却只快了 10%.md|来源: 项目只快 10%]]
推荐阅读路径
- 如果你想看全库入口与操作规则 → [[wiki/overview]]
- 如果你想理解产品主轴 → [[wiki/entities/Claude Code]]、[[wiki/entities/Codex 与 Claude Code 集成]]、[[wiki/entities/Claude Code#Artifacts:从终端输出到实时交互页面(2026-06 新增)|Artifacts 与工作展示]]
- 如果你想理解方法论 → [[wiki/concepts/Superpowers 与编程治理框架]]、[[wiki/concepts/上下文管理与 Harness Engineering]]、[[wiki/concepts/Loop Engineering]]
- 如果你想理解组织/经营层延伸 → [[wiki/entities/Workspace Agents 与企业工作流]]、[[wiki/syntheses/AI 创业与 OPC]]
- 如果你想理解配置体系 → [[wiki/entities/CLAUDE.md 与 .claude 配置]]、[[wiki/concepts/CLAUDE.md 写法指南]]
- 如果你想看冲突与争议 → [[wiki/syntheses/矛盾与视角差异]]
- 如果你想理解 Agent 编程的底层范式 → [[wiki/concepts/Agent 原理、记忆与上下文工程]]、[[wiki/concepts/Spec + RAG 与增强开发工作流]]
相关页面
- [[wiki/entities/Claude Code]]
- [[wiki/concepts/Skills、Agents 与工具设计]]
- [[wiki/concepts/Superpowers 与编程治理框架]]
- [[wiki/concepts/上下文管理与 Harness Engineering]]
- [[wiki/entities/Codex 与 Claude Code 集成]]
- [[wiki/entities/Workspace Agents 与企业工作流]]
- [[wiki/syntheses/AI 创业与 OPC]]
- [[wiki/concepts/Loop Engineering]]
- [[wiki/entities/Claude Code#Artifacts:从终端输出到实时交互页面(2026-06 新增)|Artifacts 与工作展示]]
- [[wiki/entities/CLAUDE.md 与 .claude 配置]]
- [[wiki/concepts/CLAUDE.md 写法指南]]
- [[wiki/concepts/Agent 原理、记忆与上下文工程]]
- [[wiki/concepts/Spec + RAG 与增强开发工作流]]
- [[wiki/syntheses/矛盾与视角差异]]