Clipping 微信公众号

Claude Code 砍掉 80% 系统提示词-一份 14,902 行代码的「死亡诊断书」

by AI知识体系礼记 原文 ↗
Created: 2026-07-04

公众号名称:AI知识体系礼记

作者名称:AI知识体系礼记

发布时间:2026-07-04 22:49

Claude Code 砍掉 80% 系统提示词:一份 14,902 行代码的「死亡诊断书」

当 AI 开始嫌人类写的指令太多,第一条消息,省掉了 52,000 个 Token。

2026 年 7 月 2 日,Anthropic 技术团队成员 Tariq Shihipar 在一次内部分享中调出了 Claude Code 的系统提示词文件,然后毫不犹豫地删掉了 80% 的内容。不是修改,不是优化,是删

删掉之前,Claude Code 的系统提示词在全功能开启时膨胀到了 65,000 个 Token——相当于让模型在写第一行代码之前,先读完一本 130 页的产品说明书。删掉之后,这个数字降到了约 13,000 个 Token。

即便你关闭大部分功能,那个”底线版本”也还有 12,000 个 Token。换句话说,模型还没开始干活,光”知道自己是谁、该怎么干活”这件事,就要烧掉一笔不小的 Token。作为对比,OpenAI 的 Pi 启动时上下文不到 1,000 个 Token。差了整整一个数量级。

这不只是一个技术细节的调整。这是一个信号——AI 行业正在经历一场关于”如何跟模型说话”的范式革命。



01 · 旧版解剖

一个 14,902 行的提示词帝国

要理解这次删减意味着什么,得先看看被删掉的东西长什么样。

2026 年 3 月底,有安全研究者在 Claude Code 的开源依赖链中发现了完整的提示词源码快照,GitHub 上被 fork 了数万人次。这批代码揭示了一个令人震惊的事实:Claude Code 的系统提示词不是”一段文本”,而是一套完整的运行时操作系统。

14,902 行 TypeScript 代码,分布在多个专业模块中。核心构建文件 system-prompt-builder.ts 约 3,200 行,工具定义文件 tool-definitions.ts 约 4,100 行,权限管理 permission-modes.ts 约 1,800 行,上下文注入器 context-injectors.ts 约 2,400 行,还有十几个辅助文件。这不是在写 Prompt,这是在盖楼

四层架构

旧版 Claude Code 的提示词采用严格的四层架构设计:

第一层:主系统提示词(约 3,000 Token)。这是 Claude Code 的”宪法”,定义了最基础的行为规范——不用 emoji、回答简洁、用 GitHub 风格的 Markdown、技术准确性优先于讨好用户、不要拍马屁、不要过度设计。其中有一条核心原则被反复强调:NEVER propose changes to code you haven't read——没读过的代码不许改。

第二层:工具描述提示词(约 1,500 Token)。每个工具有自己的”使用说明书”。Bash 工具约 1,000 个 Token 的描述,明确告诉你它是用来跑终端命令的,不是用来读写文件的。Write 工具约 150 个 Token,硬性约束是写已存在的文件之前必须先读取。Task 工具约 1,200 个 Token,专门列出”什么时候不该用子代理”。

第三层:子代理提示词(约 2,200 Token)。三种专用子代理各有独立指令:Explore Agent 是只读搜索专家,500 个 Token 的指令中反复强调”绝对不能修改任何东西”;Plan Agent 是架构师,600 个 Token 定义它”只能探索和设计,不能写代码”;对话总结 Agent 有 1,100 个 Token 的指令,按 8 个维度压缩对话历史。

第四层:动态系统提醒(运行时注入)。Plan 模式激活时注入 1,200 个 Token 的五步工作流,环境信息、CLAUDE.md 项目配置、Git 状态快照、Skills 元数据等也会动态拼装。

除了这四层,提示词中还嵌入了一个精妙的缓存机制:通过 __SYSTEM_PROMPT_DYNAMIC_BOUNDARY__ 标记,将整个提示词切为”静态区”和”动态区”。静态区对所有用户完全相同,可以被 Anthropic 的基础设施全局缓存,每次调用只付十分之一的 Token 费用。动态区则因用户而异,单独计费。

这个设计让 Claude Code 在长会话中能维持 80%-90% 的缓存命中率。但也意味着,静态区每增加一行指令,全局成本就跟着增加。

347 条「不要」

在公开的源码快照中,研究者统计了一个惊人的数字:系统提示词中包含 347 处 “never” 或 “do not” 等否定指令。

NEVER assume that a given library is available.
NEVER proactively create documentation files.
NEVER commit changes unless explicitly asked.
VERY IMPORTANT: You MUST avoid using search commands.
IMPORTANT: DO NOT ADD ANY COMMENTS unless asked.

**每一条都有自己的故事。**某个模型曾经假设一个库存在然后写了无法运行的代码,于是加了第一条。某个模型疯狂创建 README 文件,于是加了第二条。某个模型不请自来地执行 git commit,于是加了第三条。

这种”打补丁式”的提示词工程,是过去两年 AI Coding 行业的标准做法。Cursor 曾经花大量时间做系统提示词的 A/B 测试,针对不同模型微调提示方式。一些 benchmark 测到的提升高达 10% 到 30%——差别核心就是那几段 Prompt。

但问题是,只要 Prompt 有用,团队就会不断往里加东西。某次模型出了 Bug,加一段规则;某个边缘场景没覆盖,加一段约束。日积月累,系统提示词变成了一个巨大的、僵化的、越来越难维护的”规则化石层”。


02 · 新版解剖

从「规则驱动」到「上下文驱动」

Tariq Shihipar 在解释这次删减时,说了一句值得反复品味的话:

「这类新模型想要更小的系统提示。示例反而容易限制模型,因为它实际上比我们给出的示例更有想象力。」

这句话的潜台词是:过去我们给模型写规则,是因为模型不够聪明,需要用明确的指令来约束它的行为。但现在模型足够聪明了,那些规则反而成了枷锁。

新版提示词的核心变化可以归纳为三个维度。

① 语气的根本性转变:从命令到建议

旧版:You MUST answer concisely with fewer than 4 lines. One word answers are best. VERY IMPORTANT: You MUST avoid using search commands.

新版:A concise response is generally less than 4 lines. Brief answers are best, but be sure to provide complete information. Avoid using Bash with find, grep... unless explicitly instructed.

MUST 变成了 should,NEVER 后面多了 unless,VERY IMPORTANT 直接消失了。这不是放松要求,而是把判断权交还给了模型。

② 整块删除的”补丁规则”

旧版中一整个 “Following conventions” 的段落被删除。删掉的内容包括”When making changes to files, first understand the file’s code conventions”、“Mimic code style, use existing libraries and utilities”、“NEVER assume that a given library is available, even if it is well known” 等。“Doing tasks” 部分从 5 条规则压缩到 1 条。“DO NOT ADD ANY COMMENTS unless asked” 这种微观管理级别的指令也被移除了——因为这些行为已经通过强化学习内化到了模型中

用一个软件工程类比:旧版的做法是在运行时注入大量防御性代码来处理边缘情况;新版的做法是把这些逻辑编译进了内核,运行时不再需要。

③ 新增的能力层

删减的同时,新版并非纯粹做减法。从对最新版二进制文件的逆向提取中,发现了几个关键的增量:

  • Advisor 工具:一个由更强模型支撑的”顾问”接口,不需要任何参数,调用时自动将完整对话历史转发给审阅模型。给模型一个”遇到困难可以问老师”的通道,胜过 200 行”如何自我检查”的规则。
  • Coordinator 模式:多 Worker 编排能力,将复杂任务分解为独立工作单元,分发给专用子代理,然后合成结果。替代了旧版通过大量提示词指导任务分解的做法。
  • Feature Flags:tengu_amber_redwood2/3 等特性开关控制提示词版本的切换,可以让 Anthropic 在不同用户群体中灰度测试不同的提示词策略。
  • 团队记忆系统:在个人记忆之外新增了 team/ 子目录,支持跨开发者共享记忆。设计原则里有句值得玩味的话:“不要仅仅因为你不认识它就删除团队记忆——你的队友可能依赖它。”

03 · 为什么是现在

三股力量的同时挤压

这次删减不是发生在一个真空里。它背后是三股力量的同时挤压。

**第一股:成本危机。**Anthropic 自家公司花在算力上的钱,已经达到薪资支出的 2.3 倍。按一名高级工程师 22.4 万美元的完全成本来算,每位工程师每年对应的算力支出约为 51.5 万美元——人还没模型贵。Uber 为每位工程师每月设定了 1,500 美元的 Token 上限,花旗银行直接限制高级 AI 工具的访问,Walmart 停用了部分工具。在这种大环境下,65,000 个 Token 的系统提示词不再是技术炫技,而是财务负担。

**第二股:效率竞赛。**社区基准(benchmark)数据显示,GPT-5.x 一类新模型只用 20,000 个 Token 就拿到了高分,而上代 Claude 用 50,000 个 Token,得分反而更低。一个叫 Caveman 的开源插件从侧面印证了这个问题:重度使用 Claude Code 的开发者发现,大量 Token 花费在”寒暄、模糊措辞、过渡语”上。Caveman 相比默认输出能减少 65% 到 75% 的输出 Token,效果仍超过普通的”请简洁”指令。一个需要第三方插件来帮你省 Token 的产品,说明它的 Token 浪费已经到了忍不了的程度。

**第三股:模型能力的跃迁。**新一代基础模型的能力提升,让大量原本需要用提示词”手把手教”的行为变成了模型的内置能力。旧版中 “NEVER add comments unless asked” 这种微观管理指令,本质上是在弥补模型不够聪明的缺陷——它会自作主张地加注释。但新一代模型已经”学会”了不加注释,提示词中的规则就成了冗余。

这三股力量的叠加,让 Anthropic 不得不对自己的提示词体系动刀。


04 · 一张对照表

删掉的和留下的

维度旧版新版
总 Token 量最高 65,000约 13,000(↓80%)
源码行数约 14,902 行大幅缩减(未公开)
否定指令数347 处 never/do not大量移除,改为条件式
语气特征MUST / NEVER / VERY IMPORTANTshould / generally / unless
规则风格硬性规则 + 补丁式追加上下文引导 + 氛围式信息
子代理3 种(Explore/Plan/Summary)新增 Advisor + Coordinator
任务分解通过提示词指导通过 Coordinator 原生支持
记忆系统个人记忆 + CLAUDE.md个人记忆 + 团队记忆 + CLAUDE.md

05 · 演进曲线

「短-长-短」的三段论

Tariq Shihipar 提出了一个精妙的观察:AI 提示词正在经历一个”短-长-短”的演变周期。

**第一个”短”——早期模型(GPT-3/3.5 时代)。**提示词很短,但需要塞入大量示例和限制性指令才能控制行为。几百个 Token 就要完成所有约束。

**“长”——中期模型(GPT-4/Claude 3/Opus 时代)。**模型理解力变强,提示词越来越长。从几百 Token 膨胀到几千、几万、直到 65,000 个 Token。每次模型犯错,就在提示词里加一条规则。这是一个”军备竞赛”——谁的提示词写得更精细,谁的 Agent 表现就更好。Cursor 的 Harness 层能在 benchmark 上提升 10%-30%,核心就是 Prompt 的差异。

**第二个”短”——新世代模型(Claude 4 / GPT-5.x 时代)。**模型能力再次跃迁,大量行为已经内化,提示词开始反向收缩。从 65,000 缩到 13,000,而且还在继续缩。

这个演变揭示了一个反直觉的真相:**提示词工程的终极形态,可能不是写出完美的提示词,而是不再需要提示词。**当模型足够聪明时,你告诉它”任务背景和目标”就够了,不需要再写 200 行规则告诉它”不要犯这些错误”。因为那些错误,它已经不会犯了。


06 · 启示

对开发者意味着什么

这次删减的影响远不止 Claude Code 一个产品。它对整个 AI 开发工具生态有三个深层启示:

**启示一:Prompt 债比代码债更危险。**代码老了,改功能、跑测试时就会暴露问题。Prompt 老了,却可能只是让模型”悄悄变差”——用户感知到的是”Claude Code 最近好像不如以前聪明了”,但真实原因是旧的提示词没有跟上新模型。Anthropic 这次删掉 80%,本质上是在偿还累积了两年多的 Prompt 债。

**启示二:Agent 的竞争焦点正在转移。**过去,Agent 的差异化在提示词层——谁的 Prompt 写得好,谁的产品就好用。Cursor 花大量时间调 Prompt,能比 Claude Code 原生表现提升 30%。但当 Anthropic 自己把提示词从 65,000 缩到 13,000 时,Cursor 那套精心调教的 Prompt 体系怎么办?这个选择,将决定下一代 Agent 工具的竞争格局。

**启示三:“厚 Prompt”正在变成一种技术负债。**对于所有在用系统提示词构建 AI Agent 的团队,Claude Code 的案例是一个警示:你今天的每一条规则,都是明天需要偿还的债务。更聪明的做法是,把精力从”写更精细的规则”转向”选择更聪明的模型”——当模型本身已经学会了那些规则,你的提示词就应该跟着瘦身。


07 · 尾声

一个时代的结束

2025 年 10 月,研究者 Mikhail Shilkov 对比了 Claude Code 1.x 和 2.0 的提示词变化,当时的结论是”refinement, not revolution”——优化,不是革命。系统提示词从 188 行缩减到 169 行,工具定义从 869 行缩减到 851 行。

但到了 2026 年 7 月,当 Anthropic 一次性砍掉 80% 的系统提示词时,这已经不是优化了。这是一次范式转换。

它宣告了一个时代的结束——那个认为”给 AI 更多指令就等于更好输出”的时代。取而代之的是一个全新的逻辑:给 AI 更少的束缚,让它自己决定怎么做。

最终答案 正如 Tariq Shihipar 所说:“与其说’不要这样写’,不如告诉它当前的任务背景和意图,模型反而能给出更有创造性的解决方案。”

提示词工程的未来,不是更多的文字,而是更好的沉默。


参考来源

· The Decoder:Anthropic trims Claude Code system prompt by 80%(2026-07-02)
· IT 之家:AI 交互革命:Claude Code 系统提示词精简 80%(2026-07-03)
· 36 氪 / InfoQ:Claude Code 80% 的提示词说删就删(2026-07-03)
· 掘金:Claude Code 系统提示词完全拆解(2025-12-24)
· Tech Deep Dives:Claude Code’s 512,000-Line Leak(2026-03-31)
· Mikhail Shilkov:Claude Code 2.0 System Prompt Changes(2025-10)
· 开源仓库:asgeirtj/system_prompts_leaks · Piebald-AI/claude-code-system-prompts
· 凤凰网 / 观察者网:存在后门风险,阿里反向禁用 Claude(2026-07-03)

本文整理自公开报道与开源逆向工程数据,部分细节为社区估算,实际数值请以官方为准。


内容效果不满意?点此反馈

输入关键词开始搜索