Clipping 微信公众号

Claude Advisor:用Fable 5当顾问,Opus 4.8做执行

by 鲁工 原文 ↗
Created: 2026-07-08

公众号名称:AI编程实验室

作者名称:鲁工

发布时间:2026-07-08 16:09

大家好,我是鲁工。

今天Claude官方宣布,原定于7号关门的Claude Fable 5,延期到了12号。感觉更像是为了阻击GPT-5.6的策略。不过总算还能多蹬几天Fable 5了,刚好也赶上昨天重置了。

但12号之后,Fable 5就要真正从订阅中移除了。之后要再想用,只能按API付费了。昨天刚好,在X上看到一个数据,就是一个用Claude Code的team,具体不清楚这个team有多少人,纯用API的情况下,用Fable 5跑了24小时,结果收到了113421.87刀的天价账单。简直离谱。

同样情况下,我们看下Claude官方算的一笔账。同一批SWE-bench Pro的题(考察真实仓库编程能力的基准,官方用了482道的精选子集),全程用Sonnet 5做,一道题的名义成本0.75刀左右,准确率75%出头;全程换Fable 5,一道题涨到2.2刀,准确率能到91%。这是官方图上的两个端点,也是所有用API的人绕不开的老难题:便宜的不够聪明,聪明的太贵。

这是今天ClaudeDevs发了一条推文,在图上又标了第三个点:Sonnet 5干活,Fable 5当顾问,一道题1.4刀,准确率约84%。花六成的钱,拿到九成的分数。官方的说法是,Most tokens are billed at the lower executor rate,大部分token按便宜的执行模型计费。

这个玩法背后是API里一个叫advisor tool的功能,beta头是advisor-tool-2026-03-01,从版本号看三月就已经上线,这次配合Fable 5解禁被官方拿出来重点推。下面按文档把机制捋一遍,几处实用的调参数据也一并放进来。

一句话表述就是:你在一次请求里声明两个模型。顶层model字段填便宜的执行者(executor),tools数组里再塞一个advisor工具,model填贵的顾问:

{
"type": "advisor_20260301",
"name": "advisor",
"model": "claude-fable-5",
"max_tokens": 2048
}

执行者干活干到一半,觉得这活需要高人指点了,就像调普通工具一样调一次advisor。服务端把它到目前为止的完整对话记录(系统提示、工具定义、历史轮次、这一轮已经写出来的内容)原封不动转给顾问模型,顾问单独跑一次推理,给一段建议文本,塞回执行者的上下文,执行者接着干。

调用advisor时input永远是空的。执行者只负责决定什么时候求助,转发材料这事服务端全包。整个过程发生在同一次/v1/messages请求内部,你这边不用写任何跨模型的搬运和拼接逻辑。

完整代码段如下:

client = anthropic.Anthropic()

response = client.beta.messages.create(
model="claude-sonnet-5",
max_tokens=4096,
betas=["advisor-tool-2026-03-01"],
tools=[
{
"type": "advisor_20260301",
"name": "advisor",
"model": "claude-fable-5",
}
],
messages=[
{
"role": "user",
"content": "Build a concurrent worker pool in Go with graceful shutdown.",
}
],
)

print(response)

拿我熟悉的场景类比,这就是主治医师碰到拿不准的片子,请上级专家来会诊:专家看完整病历,给个方向性意见就走,病历还是主治医师自己写。顾问模型不带任何工具,也不做上下文管理,它的thinking在返回前就被丢掉,执行者只拿到建议正文。

有个细节需要注意一下。Fable 5当顾问时返回的是加密块(advisor_redacted_result),你自己都看不到它给了什么建议,下一轮由服务端解密后渲染进执行者的prompt;换Opus当顾问则是明文。

配对有硬性规则:顾问必须至少和执行者一样强,且最低是Sonnet 4.6。Haiku 4.5可以请Sonnet 4.6及以上的任何模型,Sonnet 5只能请Opus 4.7、4.8或Fable 5,Fable 5只能请它自己。配错了直接返回400。

省钱的逻辑也简单。Fable 5的输出价是每百万token 50美元,Sonnet 5是15美元,8月底前优惠价10美元。一个coding任务里,真正的大头是执行者生成的代码、工具调用和中间过程;顾问每次只输出400到700个token的建议,算上内部thinking也就1400到1800。

官方建议一个任务问两三次:动手前问一次方向,自认为做完了再问一次把关。文档还特意提醒,把关前先把交付物落盘,advisor调用耗时,万一会话半路断了,存盘的东西还在。这样一来,大部分token走Sonnet的价,只有咨询那几下按Fable计。

计费在响应的usage.iterations数组里分段列出,advisor_message条目按顾问费率、message条目按执行者费率,做成本核算能精确到每一次咨询。

有一处开销要留意:顾问每次都要重读执行者的完整对话记录,这部分输入按Fable 5每百万token 10美元计,对话越长越费钱。所以工具定义上有个caching开关,给顾问那边单独开提示缓存,官方口径是一个对话里问三次以上就回本。长agent循环建议开,短任务别开,中途开开关关反而全是cache miss。

还有一个玩法是:Fable 5当orchestrator做规划,把活分给一堆Sonnet 5 worker去跑。​官方在BrowseComp(考察agent联网搜索能力的基准)上测了这套组合:Fable 5领队加Sonnet 5干活,准确率86.8%,每题18.53美元;全Sonnet 5是77.8%、16.01美元;全Fable 5是90.8%、40.56美元。​官方的总结是96%的性能、46%的价格。

两个方向合起来看,advisor是便宜模型往上求助,orchestrator是贵模型往下派活。Claude Managed Agents的subagent两种都支持,每个subagent还各自维护缓存,重复调用不用为同一份上下文付两遍全价。

用Claude Code的朋友更省事,这个功能已经进了Claude Code本体,官方文档标注v2.1.98版本起可用。会话里敲/advisor指定顾问模型(也可以在settings.json里配advisorModel),主模型用/model切到Sonnet 5,就是本文这套Sonnet干活、Fable把关的组合,配对规则和API一致。

它和更早的opusplan有所区别。opusplan是Plan阶段用Opus、执行阶段切Sonnet,属于阶段之间换模型;advisor是干活中途随时求助,顾问还能看到主对话的完整记录,包括每一次工具调用和结果。这一点subagent也替代不了:给子agent的frontmatter指定再强的model,它也只拿到主agent写给它的任务描述,看不到主对话历史。

其实这种干活方式大家或多或少都在用的。用API和中转站的朋友多少都干过这种事:DeepSeek或者GLM跑量,遇到难题手动把上下文复制给GPT-5.5或者Opus 4.8问一嘴,再把答案贴回去接着跑。我看到advisor tool的第一反应就是,官方把这套手工偏方转正了。手搓版最烦的是两边上下文对不齐,转正版在服务端一次请求内解决。

现在Fable 5还在订阅内,这种advisor的组合干活方式,大家体感可能还不明显,觉得所有事情交给Fable 5去蹬就好。但12号Fable 5从订阅中下掉之后,当我们遇到GPT-5.6或者Opus 4.8都搞不定的问题时,适量付费请Fable 5来当顾问,未尝不是一个能解决问题的方法。

如果觉得有用,点个赞或者在看,也方便更多朋友看到。

感谢您阅读我的文章。我是鲁工,九年AI算法老兵,AI全栈开发者,深耕AI编程赛道与AI科研赛道。

>/ 作者:鲁工


内容效果不满意?点此反馈

输入关键词开始搜索