Claude Opus 4.8 来了,没什么大颠覆。重点是:Mythos 将于几周内发布
公众号名称:AGI Hunt
作者名称:尹John
发布时间:2026-05-29 01:38
刚刚,Anthropic 发布了 Claude Opus 4.8,在全平台同步上线:网页版、Claude 平台,以及各大云平台。

Claude Opus 4.8 发布
这次是 Opus 4.7 的一次升级,价格没变,而跟着一起上线的,还有几个新功能。
其中最暴力的一个,叫动态工作流(Dynamic Workflows),能让 Claude Code 在一次会话里调度几百个子 agent 同时干活。怎么讲,又一个新的 Token 绞肉机……
01
跑分全面提升
先说模型本身,我们来看数据。

Opus 4.8 与 Opus 4.7、GPT-5.5、Gemini 3.1 Pro 对比
编程上,Opus 4.8 在 SWE-Bench Pro 拿到 69.2%,比 Opus 4.7 的 64.3% 高出近 5 个点,把 GPT-5.5(58.6%)和 Gemini 3.1 Pro(54.2%)甩在了身后。
跨学科推理部分,Humanity’s Last Exam 不带工具拿到 49.8%,带工具 57.9%,两项都是榜首。
Agentic Computer Use(OSWorld-Verified)83.4%,知识工作(GDPval-AA)1890 分,agentic 金融分析(Finance Agent v2)53.9%,基本都是同台最高。
唯一略输一头的,是 Terminal-Bench 2.1 的终端编程:Opus 4.8 是 74.6%,GPT-5.5 在这一项以 78.2% 领先。不得不说,Anthropic 倒是非常坦诚和大方……
02
会说不知道
这次升级里,值得注意的除了跑分,还有一个非常重要的是:诚实度。
官方的说法是,Opus 4.8 让代码缺陷悄悄溜过去的概率,大约降到了 Opus 4.7 的四分之一。它会主动标出自己拿不准的地方,也不太爱说没有根据的话了。
也就是说,它会更愿意告诉你「这里我不确定」,不会再硬编一个看着挺像样的答案来糊弄忽悠你了。

会说不知道
Devin 的 CEO Scott Wu 的使用感受是:
“ 它调用工具时干净利落,执行自主工程任务时,那种该有的指令一致性它都有,连之前注释写太啰嗦的毛病也修好了。
投资分析师 Michael Ran 的体感也类似,他说 Opus 4.8 分析质量比前代稳定地更高,而最大的差别,是它会主动提示输入或输出里的问题。
03
和 Mythos 一样乖
诚实度之外,Anthropic 的对齐团队还专门测了它的「品行」。

Misaligned behavior 对比,越低越好
上图测的是模型的「不当行为(Misaligned behavior)」,分数越低越好。
Opus 4.8 拿到 1.83,明显低于 Opus 4.7 的 2.48,已经逼近内部 Claude Mythos Preview 的水平(1.78)。
对齐团队的原话是,Opus 4.8 在「支持用户自主权、为用户最大利益着想」这些亲社会特质上,达到了当前新高。
一个模型在变强的同时还能变得更让人放心,这其实比多考几分要难不少。
04
动态工作流
还有一个最暴力的功能:

动态工作流(Dynamic Workflows),目前在 Claude Code 里作为研究预览版上线。

它的核心,是让 Claude 能啃下大得多的任务:在一次会话里同时跑几百个并行的子 agent,就像把一个大项目拆给一整支团队同时开工,而且它还会在把结果报给你之前,先自己验证一遍输出对不对。

动态工作流
官方给出的例子是:跨越几十万行代码的全库迁移。这搁以前我们得拆成无数个小任务喂给它,现在,则可以一口气交给模型来完成。
目前该功能仅开放给 Claude Code 的企业版、团队版和 Max 套餐用户。
05
思考调节钮
第二个新功能,是 claude.ai 和 Cowork 里新增的努力度控制(Effort Control),就在模型选择器旁边。
调高,Claude 会想得更频繁、更深入;调低,回答更快,速率限制也消耗得更慢。所有套餐都能用。

努力度控制
Opus 4.8 默认用的是高努力度,官方判断这是质量和体验之间最平衡的一档。编程任务用这一档,token 消耗跟 Opus 4.7 的默认档差不多,但效果更好。
要是碰到特别难的题,还有「extra」(xhigh)和「max」两档可以拉满,专门留给硬骨头和长时间运行的工作流。
06
API 小升级
第三个改动是给开发者的:Messages API 现在允许在 messages 数组里中途插入 system 指令。
中途插指令,不断缓存
好处是,你能在 agent 跑到一半的时候更新指令,比如改权限、调 token 预算、换环境上下文,而不会打断 prompt cache。
07
价格不变
Opus 4.8 的价格和前一代相同:
• 常规用量:输入每百万 token 5 美元,输出 25 美元
• Fast 模式:输入每百万 token 10 美元,输出 50 美元,比上一代的 fast 模式便宜了 3 倍
API 里的模型标识是 claude-opus-4-8。
Databricks 的神经网络 CTO Hanlin Tang 给出的数字是:
Opus 4.8 在他们的 agentic 推理任务上,单 token 成本比 Opus 4.7 低了 61%。
能力涨了,单位成本反而降了。
08
接下来,是 Mythos
官方在文末还透了后续的模型路线图。
他们在做用更低成本提供 Opus 级别能力的模型,同时也在规划一个比 Opus 更聪明的新模型层级。

另外还提到了 Project Glasswing 模型:Claude Mythos Preview 目前已经部署给了少量组织,专门用于网络安全工作。Mythos 这一级的模型预计未来几周会向所有客户开放,配套更强的网络安全防护也在路上。
总的来说,Opus 4.8 没有什么惊天动地的大颠覆,更像是一次把各项能力又往前推了一小步、还顺手把「诚实」和「安全」补强了的扎实升级。
目前看来,Opus 4.8,将可能是「Mythos」之前的最后一个 Opus 系列模型了。
不过……我最好奇的是:Opus 4.8 还会提醒我该睡觉了吗?
◇ ◆ ◇
相关链接:
• https://www.anthropic.com/news/claude-opus-4-8
• https://claude.com/blog/introducing-dynamic-workflows-in-claude-code

原创 尹John AGI Hunt
修改于
内容效果不满意?点此反馈