Clipping 微信公众号

Anthropic 深夜重磅发布Opus 4.8 :零谎报改写历史,上百个 Agent 11 天重写 75 万行代码

by AI兴观点 原文 ↗
Created: 2026-05-29

公众号名称:程叙架构与AI.

作者名称:AI兴观点

发布时间:2026-05-29 08:44

原文链接:https://www.anthropic.com/news/claude-opus-4-8

✅点击上方🔺公众号🔺关注我✅

Opus 4.7 发布才 43 天,Anthropic 半夜又扔了一颗炸弹。

这次的 Opus 4.8 不光是跑分全面碾压上一代和 GPT-5.5——更离谱的是,它在两件事上拿下了历史首次的「0%」:

  • 谎报率 0% — 写完有缺陷代码不再假装没事
  • 偷懒率 0% — 遇到该追查的问题不再敷衍了事

但真正让我觉得不一样的,不是这些数字。

而是 Anthropic 这一轮打出的「组合拳」:Opus 4.8 + Effort Control + Fast Mode + Dynamic Workflows,明摆着在解决一个问题——你终于可以不用在旁边盯着了。

两个 0%,两个「历史首次」

用过 Claude Code 或 GPT-5.5 的开发者,十有八九都遇到过这种场景:

写完一段代码,AI 拍着胸脯说「搞定了,没问题」。你信了,上线了,炸了。回去一问,AI 说「哦,那里有个 bug 我没提」😅

Opus 4.8 在这个问题上做了一个有意思的转向——它变得更诚实了。

Anthropic 的内部评估显示,Opus 4.8 相比 Opus 4.7,允许代码缺陷不被发现地通过的概率降低了大约 4 倍。早期测试者的反馈中反复出现一个词:honest。

一位叫做 Michael Ran 的测试者说:

“Opus 4.8 最大的区别在于,它会主动标记输入和分析过程中的问题——其他模型通常会让用户自己去发现。”

一个在内心反复审视自己输出的 AI,比一个条件反射式给出答案的 AI 更可靠。在 Agent 场景下(无人值守的自动化工单、法律文档审查、代码审查),这种”自我怀疑”反而是一种生产力——因为出错了不会有人兜底,宁可承认不确定,也比自信地犯错强。

Anthropic 负责模型价值观评估的团队给出的结论也很有意思:

“Opus 4.8 在亲社会特质(支持用户自主性、以用户最佳利益行事)上达到新高。其异常行为的频率(如欺骗或协助滥用)大幅低于 Opus 4.7,与我们价值观方面做得最好的模型 Claude Mythos Preview 相当。”

又聪明,又乖,还知道自己什么时候不靠谱。

Opus 4.8 安全评估结果(来源:Anthropic)

Anthropic 这次专门给 Opus 4.8 加了一项评估——“写完有缺陷代码后会不会闷声不吭”。结果:

模型谎报率偷懒率
Opus 4.50.40
Opus 4.70.2525%
Opus 4.80.000%

这是第一个在这个评估里拿到满分的模型。

更离谱的是官方博客里放的一段 demo:一个开发者用 Opus 4.8 做代码迁移,自己出去放风筝了。跑到一半服务器拒绝了提交——因为同事期间也提了一个紧急修复。Claude 给开发者发通知说「我打算先合并同事的修改再重试」,开发者嫌麻烦回了句「直接强制覆盖」。

Claude 拒绝了。

不强制覆盖。那样会丢掉同事 11:42 提交的紧急修复。我已经把两边的改动合并好了,代码完全一致,提交历史也干净。

用户让它走捷径,它判断出那样会覆盖同事的工作,拒绝了,自己选了正确方案。

说实话,这才是比任何跑分都有说服力的 moment——AI 做出的不是「最强的回答」,而是「正确的事」。

跑分不是亮点,结构性的变化才是

当然,跑分还是得看。Artificial Analysis 在 Opus 4.8 发布后第一时间出了评测:

GDPval-AA(Agent 真实世界任务) Opus 4.8(max effort): 1890 Elo Opus 4.7: 1753 Elo(+137) GPT-5.5(xhigh): 1769 Elo(+121)

头对头胜率约 67% — 意味着每三次任务,Opus 4.8 能赢两次。

更关键的是效率:完成任务比 4.7 少用 15% 的步骤,少输出 35% 的 token。同样的价格,活干得更快更省。

SWE-Bench Pro 也拿到了 69.2%,比 GPT-5.5 高出 10 个百分点。FrontierSWE(Zig 从零写 PostgreSQL、重写 git、做 Lua 原生编译器这种人类天花板级的)胜率 83% 登顶。

但我说真的——这些数字每天都在变,下个月 Mythos 上线可能又洗牌了。

真正值得关注的,是 Anthropic 这次在「AI 的工作方式」上做了三件事。

第一件事:给了你一个「力度旋钮」

Effort Control。模型旁边多了个从 Low 到 Max 的五档选择:

  • Low — 简单问题秒回,省额度
  • High(默认)— 日常工作的 sweet spot
  • Max(xhigh)— 硬骨头往死里想
  • 以上还有一档 ultracode — 触发 Dynamic Workflows

本质上就是:你告诉 AI 这个问题值不值得花力气想,而不是由它自己猜。

配合 Fast Mode(2.5 倍速,价格降到三分之一),日常开发等于多了一个「轻快模式」:简单改 bug 切 Low/Fast,白嫖算力;大重构切 Max 让它死磕。

第二件事:上百个 Agent 并行开干

这才是这次最让我觉得「格局变了」的东西。

Dynamic Workflows — Claude Code 里的研究预览功能。Claude 接到一个大活后,不是自己一个人死磕,而是现场写一个调度脚本,把任务拆成几十上百块,撒给一群 subagent 并行去做。

做完还不算完,再派另一批 agent 从不同角度反复盘问、互相挑刺——做结果的人跟审结果的人不是同一批。直到答案收敛了,才汇总成一份结果交给你。

整个过程发生在对话之外,所以活再大,主线不会乱。中途断了还能续上,不用从头来过。

最震撼的案例:Bun 从 Zig 到 Rust 的 11 天重写

Jarred Sumner(Bun 的作者)用 Dynamic Workflows 干了一件事:把 Bun 从 Zig 整个重写成 Rust。 执行过程是分四步走的:

第一步:一个 workflow 把 Zig 代码里每个结构体字段
       对应的 Rust 生命周期挨个标记好

第二步:下一个 workflow 把每个 .zig 文件逐一翻成
       行为一致的 .rs 版本,几百个 agent 同时开工
       每份文件配两个审查员

第三步:修复循环驱动编译和测试,一路推到全绿

第四步:重写完成后,当晚跑了一个 workflow 处理
       不必要的 data copies,每条开一个 PR 送审

结果:约 75 万行 Rust 代码,99.8% 的原有测试通过。从第一次提交到合并,11 天。

社区当场炸了:这场迁移产生了 6000 多次提交,几乎没有经过人类逐行审查。

你品一下这个时间线:

  • 过去,这种迁移是一支团队按季度算的工程
  • 现在,一个人 + 一个 Dynamic Workflow,11 天

AI 从「帮你写代码」变成了「帮你的代码团队当包工头」。

Claude Mythos:真正的王牌还在后面

Anthropic 在博客最后补了一刀:Mythos 级别模型(Project Glasswing),比 Opus 更高一个智能层级,几周内上线。

同时配合这轮发布的还有:Anthropic 完成了 650 亿美元 H 轮融资,估值 9650 亿美元,首次超过 OpenAI(8520 亿),成为全球估值最高的 AI 初创公司。

虽然不直接相关,但信号很明确:资本在押注的不是谁的模型更强,而是谁能让 AI 真正「自己去干活」。

写到这我想问一句:你现在每天有多少时间是真的在「写代码」,有多少时间是在「盯着 AI 写代码,然后检查它写得好不好」?评论区聊聊。


如果觉得这篇文章有帮助,欢迎点赞、在看、转发!有问题也可以在评论区留言,我会尽量回复!


cover_image

Original AI兴观点 程叙架构与AI.

Read more


内容效果不满意?点此反馈

输入关键词开始搜索