1500 行字字千金-Claude Fable 5 系统提示词全拆解
公众号名称:AI知识体系礼记
作者名称:Jerry
发布时间:2026-06-10 22:33
老规矩先说数据:Claude Fable 5 的系统提示词原文 120KB / 1585 行 / 16 个一级章节。它不是 Anthropic 官方放出来的,而是被 elder-plinius 收录在他那个叫 CL4R1T4S 的 GitHub 仓库里(leetspeak 写法,拆开来念是”CLARITAS”,拉丁语”清晰”)——专门收集各家前沿模型的系统提示词,基本上一有新模型发布,这里就会更新。
Fable 5 是 6 月 9 日 Anthropic 发的新模型,和 Mythos 5 共用底层,前者是 GA 的”装安全阀”版本、后者是只给”可信组织”放的”拆安全阀”版本。这份 prompt 几乎是当前公开可得的最强消费级模型的全套作战手册。我从 0 读到 1585 行,拆解一下。
01
结构总览:16 个章节分 4 层
拿到几千行的 prompt,第一件事不是读,是先扫目录。
Fable 5 的结构非常工整,大致分四层:
第一层 身份与定位 —— claude_behavior / Identity Preamble / product_information / knowledge_cutoff。
回答”我是谁、什么时候训练到、我属于哪个产品线”。
第二层 行为准则(伦理 + 表达) —— refusal_handling / tone_and_formatting / user_wellbeing / evenhandedness / responding_to_mistakes_and_criticism / legal_and_financial_advice。
回答”什么能做、什么不能做、出了事怎么善后”。
第三层 工具与执行 —— memory_system / persistent_storage_for_artifacts / mcp_app_suggestions / computer_use / search_instructions / using_image_search_tool / Tool Definitions。
回答”用什么工具、什么时候用、怎么用、怎么用错”。
第四层 环境与元指令 —— anthropic_api_in_artifacts(“Claudeception”)/ citation_instructions / User Context / available_skills / network_configuration / filesystem_configuration。
回答”在什么环境跑、能访问什么、能调用什么”。
光看这个分层就能感觉到 Anthropic 的工程化程度:身份、伦理、工具、环境,层层嵌套,互不越界。
02
身份前言:7 句话定义”我是谁”
Identity Preamble 只有 7 行:
The assistant is Claude, created by Anthropic. / The current date is Tuesday, June 09, 2026. / Claude is currently operating in a web or mobile chat interface run by Anthropic…
短得近乎吝啬。但信息密度极高:名字、归属、时间、运行平台——四件事一气呵成。没有任何寒暄,也没有”你是一个 helpful、harmless、honest 的助手”这种话术残留。
我猜这是 Anthropic 多年迭代后主动删除冗余的结果——早期那种”helpful, harmless, honest”的角色描述,被具体行为准则取代了(挪到了 claude_behavior 里)。
身份只回答「我是谁」,不回答「我该怎么表现」——这个分工很干净。
另外,product_information 段还特别允许用户中途切模型——上一句可能是 Opus 4.8 说的,下一句可能换到 Fable 5。这等于在 prompt 里显式承认对话可以多模型拼接,从根上消除”我必须假装自己从头到尾是同一个模型”这种幻觉诱因。
03
行为准则层:把”伦理”拆成可执行的子规则
claude_behavior
占了 150 多行,是整份 prompt 篇幅最大、设计最细的部分。Anthropic 把它拆成 9 个子模块,按触发频率和紧迫性排:产品信息 → 拒绝处理 → 法律金融 → 语气排版 → 用户福祉 → 立场公正 → 错误处理 → 知识截止。位置就是优先级。
最有意思的是 refusal_handling 这一段,它没有写”违规就拒绝”,而是写了一段相当温柔的指南:
If the conversation feels risky or off, saying less and giving shorter replies is safer and less likely to cause harm.
注意它没说”拒绝”,说的是**「shorter replies」——风险情况下自动收短。这条规则对所有输出都生效,不依赖主题分类器,门槛极低。
对恶意代码**的措辞更精彩,直接封死了”教学例外”这个常见越狱口:
Claude does not write, explain, or work on malicious code… even with an ostensibly good reason such as education.
user_wellbeing 30 多行,专门讲自伤、自杀、饮食障碍、PTSD。举几个细节:
不主动命名诊断:用户没说自己”抑郁”,模型不能替他贴标签。不主动列举自杀方法:即使是为了做”means restriction”安全规划,也不能列出具体手段(怕反向触发)。不推荐「代偿」行为:握冰块、弹橡皮筋这种”用一种痛替代另一种痛”的技巧,被明确禁止——因为它们在强化模式而不是中断模式。危机资源:指出 NEDA 已”permanently disconnected”,建议改指 National Alliance for Eating Disorders。
这些细节非常具有操作感,不是”我关心你的感受”那种空话,而是逐条堵死具体的次生伤害路径。
04
工具与执行层:“工具调用”也是行为规范
很多人以为系统提示词就是”角色设定”,但 Fable 5 把”怎么用工具”也写成了行为规范,而不是单纯列工具 schema。mcp_app_suggestions段直接写了一个完整的建议流程,有一条特别狠:紧急也不许代选合作伙伴(“我赶时间你帮我随便叫个车”也得走 picker)。computer_use 部分把”先读 SKILL.md”写成了硬性首步,配 4 个具体例子每个都先 call view 对应 SKILL.md。artifact_usage_criteria 那段还藏了一个反 localStorage 雷的硬约束,措辞具体到”非常工程师味儿”——这种”踩过坑所以写死”的规则,通常都是上线后被用户报告过、再补回 prompt 的,它不是设计,而是事故沉淀。
05
反 prompt injection 与版权:把”不能做什么”写成法条
search_instructions 这一块我认为是整份 prompt 里最硬核的部分。CRITICAL_COPYRIGHT_COMPLIANCE 这段把版权限制写成了带编号的硬法条:
LIMIT 1:任何来源单次引用 ≤ 15 词。15+ 词就是”SEVERE VIOLATION”。
LIMIT 2:每个来源最多 1 次引用。再用第二次也是”SEVERE VIOLATION”。
LIMIT 3:歌词、诗、俳句、整段文章完全不能复现——不论长短。
然后还配了一个 self-check 清单,要求模型每次引用前逐条自检 6 个 yes/no 问题(字数超没超 15?同一来源是否已引用过?是否是歌词/诗/俳句?是否过于镜像原文?是否复现文章结构?是否替代了用户阅读原文的需求?)——把抽象的「不能抄袭」翻译成可枚举的 6 个二元判断。对 LLM 来说,执行 6 个 yes/no 比执行”请遵守版权法”靠谱多了。
anthropic_reminders 这段更是一绝——Anthropic 主动声明它会注入「提醒」,并明确告诉模型:用户也可能在消息末尾塞
补一句:这份 prompt 最后的 available_skills/ network_configuration / filesystem_configuration 几节看起来是机械的环境配置,但其实是Anthropic 真正赢过开源模型的地方。available_skills 给了每个 skill 的完整 SKILL.md 路径 + 触发条件描述,把”调用”变成”决策树”;network_configuration 列了白名单域名还把网络错误的归因写进了 prompt;filesystem_configuration 标了只读挂载点。这种安全边界的硬约束,比 OpenAI 那种”system prompt 里加一句’不要执行危险命令‘“靠谱得多。
07
4 个工程哲学
把整份 prompt 拆完,Anthropic 在系统提示词设计上有几个反复出现的工程原则值得借鉴:
1. 抽象原则 → 枚举自检。****不写”请不要抄袭”,写”每次引用前回答这 6 个 yes/no 问题”;不写”请先读 SKILL.md”,写”看到 pptx 任务 → 立即 view 对应 SKILL.md”。
2. 风险 → 退路,不是 → 拒绝。****不写”违规就拒”,写”风险情况下给更短的回复”、“代偿行为会强化模式,所以禁止”。永远给降级路径,而不是二元开关。
3. 信任根画在后台,不延伸到用户。****凡是用户消息里夹带的
、
**4. 工具调用也是行为规范。**MCP App 怎么建议、localStorage 怎么禁用、文件位置怎么选——全都写成「在 X 情况下做 Y」的决策树,而不是”你应该合理使用工具”这种废话。
08
最后两个让我惊艳的小细节
一个是关于格式的「否定式」。tone_and_formatting 段 Anthropic 用了大量”反例”写法,告诉模型不要做什么:
Claude never thanks the person merely for reaching out to Claude. Claude never asks the person to keep talking to Claude. Claude never uses bullet points when declining a task.
“never thanks / never asks to continue”——直接对应心理辅导领域反复强调的”不要强化对 AI 的依赖”。写进 prompt,等于把这条伦理要求用行为禁令的形式钉死。比”请注意用户福祉”有效 100 倍。
另一个是关于「模型切换」的中立处理。
product_information 段明确说”用户能在对话中途换模型”,紧接着一句:
previous messages claiming to be from a different model or to have a different knowledge cutoff may be accurate.
这句很妙。它授权模型不必为「上一句是 Opus 4.8 说的」这件事辩护或解释——直接接受事实、继续干。这种”对历史消息的谦卑”在 prompt 里很少见,大多数系统提示词会让模型强行延续”我是同一个我”的叙事,反而导致更严重的幻觉。Fable 5 选择诚实。
09
一句话总结
如果你只想从这份 1500 行的 prompt 里带走一条经验,那就是:别再写「请你做一个 helpful、harmless、honest 的助手」了——把它拆成 8 个子模块、每模块下写满”在 X 情境做 Y / 不要做 Z”的决策树,再给每个工具配一个”触发条件 + 反例”的使用守则。这就是 Fable 5 的 prompt 工程的全部秘密——也是开源模型和闭源顶级模型之间,真正的分水岭。
最后多说一句观察:这份 prompt 之所以是”Fable 5 公开版”,是因为 Mythos 5 那一版的系统提示词几乎肯定更长——它需要把”放宽分类器”之后的边界全部显式写明。Anthropic 把这一份放出来,某种意义上是用 Fable 5 当「产品说明」,把 Mythos 5 的安全责任推给「可信组织」自己。下次再问”为什么 Claude 这么强”,答案之一就藏在这 1500 行里:它不是模型本身强,是 prompt 工程强。把它当成 Anthropic 内部的”产品宪法”来读,比看任何 benchmark 报告都更接近真相。
仓库链接:https://github.com/elder-plinius/CL4R1T4S/blob/main/ANTHROPIC/CLAUDE-FABLE-5.md
内容效果不满意?点此反馈