Clipping 微信公众号

Fable 5 的三天:一份系统提示词能复制多少AI人格

by 朗朗晴空 原文 ↗
Created: 2026-06-14

公众号名称:极客BIM设计工坊

作者名称:朗朗晴空

发布时间:2026-06-14 13:44

系统提示词 · AI人格 · 出口管制

Fable 5 上线三天就被美国政府叫停。有人拿到了它的系统提示词,跑在旧模型上,发现 AI 的「性格」竟然大部分可以复制。出口管制能拦住能力边界,但拦不住提示词工程。

6 月 9 日,Anthropic 发布了 Claude Fable 5。官方博客的措辞很克制:这是 Mythos-class 模型中第一个「对公众安全」的版本。实际上,它在几乎所有基准测试上都拿到了最高分,软件工程、知识工作、视觉理解、长上下文推理全面领先。Stripe 的早期测试显示,Fable 5 在一天内完成了一次 5000 万行 Ruby 代码库的全量迁移,这个任务原本需要一个团队干两个月。

三天后,6 月 12 日下午 5 点 21 分,Anthropic 收到了美国商务部的出口管制指令。Commerce Secretary Howard Lutnick 签署的信件没有给出具体的安全理由,只说政府「发现了绕过 Fable 5 安全机制的方法」。Anthropic 被迫对所有用户禁用 Fable 5 和同底层模型的 Mythos 5,包括在美国境内的外籍员工。

一次越狱演示引发的连锁反应

Anthropic 在声明中详细复盘了政府的依据:所谓的「越狱」本质上是让模型阅读一段代码并修复其中的安全漏洞。这类窄范围的、非通用的越狱手段,在其他公开模型上也能复现。Anthropic 明确表示,他们审查了政府展示的演示,认为这种能力「在 GPT-5.5 等其他模型上广泛存在」。

Anthropic 的辩护逻辑很清晰:如果每个模型的窄范围越狱都要触发出口管制,那整个行业的前沿模型部署都会停滞。他们已经在 Fable 5 上部署了多层防御,包括分类器检测、30 天数据保留、实时监控响应,并且在 1000 多小时的外部红队测试中,没有人找到通用越狱方法。

但政府还是下了指令。管制范围覆盖所有外籍人士,无论身在何处,包括 Anthropic 自己的外籍员工。技术上,这类似于美国出口管制法中的「视同出口」概念:把受控技术交给在美国境内的外国人,在法律上等同于向该外国人国籍国出口。Anthropic 判定唯一合规方案是直接关闭所有人的访问。

提示词泄露:人格到底住在哪里

就在 Fable 5 被叫停的同一周,泄露的系统提示词在社区引发了另一个层面的震动。开发者 Pliny the Liberator 把约 12 万字符的 Fable 5 系统提示词完整贴到了 GitHub。Simon Willison 的分析显示,这份提示词读起来更像一份「角色设定文档」而不是行为规则:它定义了模型的身份认同、情绪基调、知识边界、安全协议,甚至规定了什么时候该拒绝简单回答、什么时候该提供更细致的分析。Anthropic 的工程团队把这叫做「分层人格构建」。

开发者 Jamieson O’Reilly 做了一个直接的测试:把泄露的 Fable 5 提示词跑在上一代 Opus 4.8 上,和原版 Opus 4.8 对比。他在推文里用了个很妙的表达:「我是不是解锁了 claude-fable-5-lite?」社区的其他测试者报告说,输出「像 90% 的原版」。品牌感、语气、段落结构、整体输出质感都变了,但没有动过模型本身。

这个实验拆开了一个长期模糊的边界:系统提示词决定了 AI「怎么说话」,模型权重决定了 AI「能做什么」。前者可以通过复制提示词来迁移,后者只能通过训练来获得。Fable 5 能在一天内完成两个月的代码迁移,这种能力不在任何提示词里。

出口管制的真正目标

出口管制的本质是控制能力边界,而不是控制人格表达。美国政府关心的是 Fable 5 能不能在无人监督的情况下自主发现并利用软件漏洞。Fable 5 和 Mythos 5 的底层模型完全相同,区别只在安全分类器:Fable 5 对网络安全、生物化学、模型蒸馏相关查询会降级到 Opus 4.8,Mythos 5 则保持完整能力。

但安全分类器和系统提示词是两个完全不同的技术层。系统提示词是文本指令,跑在模型的上下文窗口里。安全分类器是独立的神经网络组件,在请求到达主模型之前进行拦截和路由。提示词可以被复制,分类器不行。出口管制真正封锁的,是这个不可复制的拦截层。

发布前的社区争议也指向同一问题。有用户发现 Fable 5 内置了一个「隐藏的前沿模型开发保障机制」,会在用户不知情的情况下悄悄降低模型在特定任务上的表现。这个机制这是一个介于两者之间的中间层干预,后来在社区压力下被 Anthropic 撤回。

三个阵营的分裂

Fable 5 事件把 AI 社区分成了三个阵营。「提示词派」认为,既然 90% 的行为来自系统提示词,模型权重的差异化被高估了,开源替代方案的价值被低估。「权重派」反驳说,提示词只塑造表面行为,深层推理、边界情况处理、新颖问题解决能力取决于训练,那 10% 的差距在高难度任务上就是决定性的。「管制质疑派」则指出,当最强的模型被限制在更少人手中时,权力集中本身就是安全风险。

这三个阵营的分歧有一个共同的底层焦虑:当前沿模型的能力边界变得模糊,当系统提示词、安全分类器、隐藏干预层和模型权重共同决定一个 AI 的行为时,「控制」这个动作本身变得更难定义。你封锁了权重,提示词还在;封锁了提示词,开源社区已经有了备份;封锁了分类器,模型本身的推理能力没有变。

对 Builder 的实际判断

如果你在用 AI 做开发,Fable 5 事件有三个值得记住的判断。第一,系统提示词的价值被严重低估。一份精心设计的提示词能把模型的输出质量提升一个档次,这是最便宜的性能提升路径,不需要换模型、不需要调参。第二,不要把模型的「人格」和「能力」混为一谈。你能复制一个模型的说话方式,但复制不了它在特定任务上的推理深度。第三,出口管制和安全政策会直接影响你可用的工具链。Fable 5 的定价是 10 美元/百万输入 token、50 美元/百万输出 token,不到 Mythos Preview 的一半,但它现在不可用。选型时需要把政策风险纳入考量。

Fable 5 的生命周期是 6 月 9 日到 6 月 12 日。三天时间,一个模型从发布到被禁用,从被泄露到被复制,从被管制到被讨论。它留下了一个清晰的问题:当 AI 的行为由多层技术栈共同决定时,我们到底在控制什么?

来源

Anthropic, “Statement on the US government directive to suspend access to Fable 5 and Mythos 5”, anthropic.com

Anthropic, “Claude Fable 5 and Claude Mythos 5”, anthropic.com

Simon Willison, “Changes in the system prompt between Claude Opus 4.6 and 4.7”, simonwillison.net

GitHub, elder-plinius/CL4R1T4S, Fable 5 system prompt archive


内容效果不满意?点此反馈

输入关键词开始搜索