Clipping 微信公众号

半年52 倍优化,颠覆认知。Anthropic 报告里更值得深挖的信息是:AI 迭代飞轮已启动,甚至参与研究决策了。

by AI兴观点 原文 ↗
Created: 2026-06-05

公众号名称:程叙架构与AI.

作者名称:AI兴观点

发布时间:2026-06-05 12:40

✅点击上方🔺公众号🔺关注我✅

Anthropic 研究院(The Anthropic Institute)今天发布了一份重要报告——《When AI builds itself》。这是一份关于”递归式自我改进”(recursive self-improvement)的内部数据披露。

翻译过来就是:当 AI 开始自己造更好版本的自己。

这不是科幻设定。下面是用坐标定位后的官博全文翻译。


引言

在 AI 发展的大部分历史里,人类推动着开发过程中的每一个步骤。但在 Anthropic,我们正将越来越多的 AI 开发工作交给 AI 系统自己完成——这也在不断加快我们的工作速度。

如果这条趋势走到底,再配上足够的算力,它就指向一个能够完全自主设计和开发下一代继任者的 AI 系统。这被称为递归式自我改进。我们还没到那一步,它也不是必然发生的。但它来得可能比大多数机构准备的速度更快。

利用公开基准和之前未公开的 Anthropic 内部数据,Anthropic 研究院正在展示 AI 已经如何加速了 AI 系统本身的开发。举一个例子:今天,Anthropic 工程师平均每个季度的代码交付量是 2021–2025 年期间的 8 倍

AI 能够自己建造自己,这将是技术史上的一个里程碑——它能在科学、医疗等领域带来巨大的福祉。但完全的递归式自我改进也可能增加人类失去对 AI 系统控制的风险。

以下从时间线开始,逐步展开全文。


外部世界的证据

AI 模型能力提升的速度本身就在加速。它们能独立完成的任务时长大约每四个月翻一番——这比之前每七个月翻一番的趋势更快。

具体数据:2024 年 3 月,Claude Opus 3 能完成人类约 4 分钟的软件任务。一年后,Claude Sonnet 3.7 能完成约 1.5 小时的任务。又过一年,Claude Opus 4.6 做到了 12 小时任务。如果这个趋势持续,需要数天的任务可能在今年内进入范围。到 2027 年,AI 系统可能能完成人类需要数周的任务。

同样的趋势出现在编码和研究基准上:

SWE-bench(真实软件工程测试——给模型一个真实代码仓库和一个 bug 报告,要求修复问题并通过项目自己的测试):模型从低个位数得分到饱和该基准,只用了两年。

CORE-Bench(测试模型能否复现已有研究——这是进行原创研究的前提):AI 系统从 2024 年约 20% 的成功率到15 个月后饱和该基准

METR(衡量模型完成长周期任务能力的基准)发现 Claude Mythos Preview 能够工作”至少 16 小时”,且处于”METR 在不创建新任务前提下能测量的上限”。


Anthropic 内部证据

建造一个前沿模型需要两大类工作。一是工程:写代码、搭建基础设施、监督模型训练。二是研究:决定做什么实验、解读结果、判断下一步尝试什么方向。

在工程和研究两个领域,结论是一致的。

在工程方面,Claude 可以被交到一个模糊定义的问题面前,然后自己找出解法——人类提供目标,但不再需要提供方法。在研究方面,Claude 在执行一个明确指定的实验时已经能达到、甚至超越人类熟练度。然而,在判断选择什么目标这件事上——工程和研究都是——巨大的差距仍然存在。这就是今天的 AI 与未来能自主设计继任者的系统之间的差距。

代码产出:80% 由 Claude 撰写

截至 2026 年 5 月,Anthropic 合并的代码中超过 80% 由 Claude 创作。在 Claude Code 于 2025 年 2 月推出研究预览之前,这个数字还是个位数。

这个转变也体现在每个工程师的产出量上。人均合并代码行数在 Anthropic 的前四年(2021–2024)保持平稳,然后在 2025 年 Claude 开始自己运行代码(而不仅仅是建议代码供人复制粘贴)时开始攀升。这个斜率在 2026 年模型开始能够长时间自主工作后再次陡峭化。

图上标注了八个模型的发布时间线。2026 年 Q2,典型工程师人均合并代码量是 2024 年的 8 倍。

需要说明的是:代码行数是一个不完美的度量标准,它衡量的是数量而非质量。所以 2026 年 Q2 的 8 倍很可能是真实生产力提升的夸大。但它仍然指向了加速

在一项对来自 Anthropic 各研究团队的 130 名员工进行的匿名问卷调查中(2026 年 3 月),受访者的中位数估计是:在使用 Mythos Preview 的情况下,他们能产生大约不使用 AI 时的 4 倍产出

还有一项引人注目的数据:2026 年 4 月,Claude 交付了 800 多个修复,将一类 API 错误降低了一千倍。监督 Claude 的工程师估计,人类需要四年才能完成这项工作——解决别人的 bug 是缓慢而艰辛的,人类很难在脑子里同时容纳那么多不熟悉的上下文。

代码质量:已持平,一年内将超越

线上事故数据是更好的衡量标准。在 Anthropic 工程师开始将关键工作委托给 Claude 后,事故率不仅没有上升,反而有所下降

Claude 写的代码是否真正”好”?“好代码”意味着两件事:它能工作,而且它是以能让另一个工程师理解并在此基础上继续工作的方式编写的。

在第一个标准上,证据是清晰的。Anthropic 员工纠正、转向或中途接管 Claude 任务的频率在一年中持续下降——包括在最复杂、最开放的任务上。在这些有定义不清晰的问题上,工程师自己也不确定答案应该长什么样。

横轴为不同模型版本,纵轴为成功率。四条线分别代表简单任务(接近 100%)、常规任务(约 80-90%)、重要任务(约 80%)和开放型问题(26% → 76%)。

在最开放的任务上,Claude 的成功率在 2026 年 5 月达到了 76%——六个月上升了 50 个百分点

举个例子:一次例行升级导致数万个训练任务崩溃。工程师把 Claude 指向了现场的实时事故,仅仅给了一些文本内容和集群访问权限。Claude 逐一排查正在运行的作业,一次测试一个环境配置,最终隔离了一个隐蔽的调试标志——一个因升级意外残留的、已经废弃的设置。两小时。 该工程师估计正常情况下需要两到三天。

关于代码质量的内部共识也在变化:大多数人认为 Claude 的代码质量已经与人类工程师持平。Anthropic 的预期是——一年内将全面超越

另一个反直觉的数据:Anthropic 用 Claude 做自动化代码审查,回溯分析后发现——如果每个代码变更都经过 Claude 审查,大约三分之一曾导致线上事故的 bug,在上线之前就会被抓住

AI 研究:52 倍优化与 64% 的决策胜率

如果说工程是”执行”,那研究就是”判断”。

每个新模型发布时,Anthropic 都会跑同一个测试:给一段训练小模型的代码,让模型优化到最快,同时保持正确。

**2025 年 5 月(Claude Opus 4)**:平均 3 倍加速。 **2026 年 4 月(Claude Mythos Preview)**:平均 52 倍加速。

对比:一个熟练的研究员花 4–8 小时,能做到大约 4 倍加速。

但更值得关注的是研究层面的进展。Anthropic 在 2026 年 4 月发表了一个 Claude 完全自主进行端到端研究的结果。这个 W2S(Weak-to-Strong)研究设定是:Claude Agent 被丢进一个 AI 安全研究课题——弱模型能否可靠地监督强模型——然后完全自主地提出假设、设计实验、分享发现、迭代方案。

结果:两个人类研究员花了一周时间收敛了 23% 的解决方案差距。Claude Agent 花了 800 小时的累积计算量,收敛了 97%

但这还不是最关键的——执行一个已经想好的实验是一回事,决定做什么实验是另一回事。

Anthropic 做了一个巧妙的实验:从真实 Claude Code 研究会话中截取人类研究员走了弯路的节点——他们选了一个方向,结果跑偏了很久。然后问 Claude:「如果你在这个节点做决策,你会怎么做?」

横轴为九个版本:Claude 3 Haiku → Sonnet 4 → Sonnet 4.5 → Haiku 4.5 → Opus 4.5 → Sonnet 4.6 → Opus 4.6 → Opus 4.7 → Mythos Preview。纵轴为胜率。Mythos Preview 在 64% 的节点上比人类选得好。

结果:2025 年 11 月,Claude Opus 4.5 在 51% 的情况下比人类选得好。2026 年 4 月,Claude Mythos Preview 提升到了 64%

这个实验只选了”人类确实走了岔路”的节点(n=129)。它比的是:在人类也容易犯错的地方,AI 会不会犯同样的错。 答案是:越来越不会。


Anthropic 未来的工作会是什么样子?

证据表明,在 AI 开发过程的每一个步骤中,人类的角色都在缩小。

一旦人类和 AI 编写的代码质量达到一致,人类将彻底停止写代码,转而只做审查。但如果人类审查代码的速度跟不上 Claude 生成代码的速度,“人审”本身就会变成瓶颈。

同样,一旦 Claude 能自己跑实验,问题就变成了:“哪些实验值得跑?”

简单说:“做”(写代码、跑实验、产出结果)现在几乎不需要花人类时间了,即使它仍然需要计算成本。

人类目前的比较优势是研究品味和判断力——选择哪些问题真正重要、哪些结果值得信任、什么时候一条路是死胡同。

但一个来自 Anthropic 员工的内部投稿说得很真实:

“在一切都顺利的日子里,我忍不住觉得我做的事毫无意义——一切都自动化了,比我更好更快。但在一切都崩掉、我不理解为什么崩、意识到我根本不知道自己在干什么的日子里——那种感受更糟。“


如果我们错了呢?

对于上面呈现的证据,一个自然的反驳是:仍然掌握在人类手中的工作——选择做什么问题——才是最重要的。没有这种判断力,Claude 只是一个能干的助手,而不是能自主推动 AI 进步的系统。

今天 Claude 是否真的能获得”研究品味”,目前尚不清楚。但 AI 的进步很少来自”尤里卡时刻”。

Transformer 和混合专家模型这样的范式突破几年出现一次。绝大多数时候,进步是渐进的:放大某个东西、看它在哪崩了、修好、再试。

后者恰恰是 Claude 现在最擅长的。

爱迪生说天才是 1% 的灵感加 99% 的汗水。但汗水正在被自动化。越来越清楚的是,大部分推动前沿前进的工作都是可自动化的——大规模的研究进步,本质上取决于你跑实验的速度、能同时跑多少个、以及多快能得到结果。

即使最保守地读这些数据——假设 Claude 永远达不到好的”研究品味”——仅仅靠加速实验迭代速度这一项,就足以带来持续加速的复合增长。


可能的前景

如果当前的趋势持续,到 2027 年,AI 系统可能能够自动化大部分 AI 研究工作。这不需要 AI 在每件事上都超越人类——即使只是自动化”坚持不懈”这一项(在人放弃的地方继续试),就可能被证明有变革意义。

但这里有一个关键不确定性:目前的路径依赖大量人类在循环中做判断。如果我们拿走人类判断,系统还能做出正确的决定吗?


我们应该做什么?

Anthropic 研究院成立的目的,正是为了分析这些越来越强大的、可能自我改进的系统所带来的影响——并寻找赋予世界做出审慎选择的能力。

这不是”快速行动、打破常规”——而是审慎地行动,选择那些能最大化积极结果、最小化风险的发展路径

你可以访问 anthropic.com/institute 了解更多。


如果觉得这篇文章有帮助,欢迎点赞、在看、转发!你觉得「AI 自己迭代 AI」这件事应该设什么样的边界?评论区聊聊。


内容效果不满意?点此反馈

输入关键词开始搜索