Clipping 微信公众号

Superpowers 6.11 发布:Fable 5 夜里自跑25个实验,开发成本砍半!

by AI兴观点 原文 ↗
Created: 2026-07-07

公众号名称:程叙架构与AI.

作者名称:AI兴观点

发布时间:2026-07-07 09:50

原文链接:https://primeradiant.com/blog/2026/superpowers-6.html

✅点击上方🔺公众号🔺关注我✅

45 个小时,25 个实验,$165 的 token——一个开发框架把自己改了一半。

Superpowers 是一套给 coding agent 用的开发流程。你告诉它想法,它跟你对需求、出 spec、拆任务、TDD 红绿重构、代码 review,然后完成。它不绑定 IDE 或模型,Claude Code、Codex、Cursor 都能跑。

这套流程很扎实,但有两个一直被吐槽的问题:慢,贵。创始人 Jesse Vincent 不是没想改,是一直没找到好的突破口。直到 Anthropic 发布了(又撤回的)Fable。

Superpowers 6 比上一代快 50%,省 60%。

而且最值钱的改进不是 Jesse 熬夜搞出来的——是 Fable 在他睡觉时自己跑出来的。


Superpowers 6 的核心改进

过去几周 Jesse 一直在准备 5.2 版本。Fable 的出现让他把眼光放到了更大的优化上。除了速度 50%、token 60% 的账面上的提升,Superpowers 6 还有几项来自官博的升级。

新平台支持: Pi、Antigravity、Kimi Code 现在都可以跑。同时对 Codex、OpenCode、Cursor 做了更好的兼容。

底层 skill 架构重构: 大量 skill 被改写成模型和平台无关,不管跑在哪个 Agent 上行为都更稳定。GitHub 上已经有人开始按新的 contribution guide 接入新平台。

Visual Brainstorming 升级: 视觉构思功能更好用了,也更安全、更可靠。

修了一批 bug: 包括一个挺恶心的——代码 review subagent 有时候不是在 review 当前任务,而是把整个分支拎起来再审一遍。

但这些改进都不如 Fable 实验里挖出来的那三个优化值钱。


三刀砍在关键位置

Jesse Vincent 发的那条总结推文

1. Code review 合并。 原先每个任务要过两轮 review:一次检查 spec 合规(有没有做多或做少),一次检查代码质量。两个 agent 各看各的,中间大量上下文切换。合并后省了大幅 token 和耗时。

2. 预生成 review packet。 review agent 不需要自己跑 git 查 diff。提前把格式好的 diff 和元数据打包好,reviewer 拿到就能审。光是这一步就砍了大约 10% 的 token。

3. 动态 agent 分配。 简单任务派便宜模型(Haiku),复杂任务派强模型,不再一刀切。省了 $0.5–$1 每个任务,而且便宜模型执行简单任务的质量完全没问题。


45 小时实验是怎么跑的

第一天下午,Jesse 在 Fable 里丢了一行指令:

/goal once this is done, run an autoresearch loop to improve cost-efficiency 
of the superpowers build loop. test with opus as the coordinator. 
make an hypothesis log. run experiments. run at least 25 experiments.

Fable 自己搭了一个完整的 auto-research 框架,通宵跑了 25 个实验。

Jesse 在官博里说,他一开始预期 token 能省 15% 就满足了(primeradiant.com/blog/2026/superpowers-6)。第一天发现把 review handoff 流程改成预生成 review package,token 和耗时同时降了约 10%。那天晚上他在内部 Slack 说应该试试把两个 review agent 合并。

第二天醒来看见 Fable 已经自己得出同样的结论,写完实现,跑完 eval,又省了 15%。

第二晚更激进——25 个实验,Fable 通宵跑,Jesse 全程没碰。他后来在采访里说,大部分实验他根本不需要盯着,Fable 会自己构建框架、提假设、验证、记录。

25 个实验里 6 个被标记为 already-optimal——系统自己判断「当前已经最优,不需要改」。还有 3 个 Jesse 的测量 bug 在实验中被 Fable 自动发现并纠正了。一个原本以为是 −74% 的优化,修完 bug 后诚实显示为 −41%。依然是大幅优化,但避免了虚假汇报。

auto-research 循环的最终报告——基线 vs 优化后的成本、耗时、token 对比


关键实验发现

发现数据本质
精简 review 指令输出 −41%,判决准确率不变说清楚比写长文档有用
限制 controller 的 think❌ 轮次从 92 涨到 138,输出翻倍Thinking 买的是效率,不是冗余
压缩 plan 描述文字测试内容 −62%(即使代码豁免)Plan 是指明方向的框架,不是照着打的代码
Sonnet 生成 plan保真度在,但任务结构坍塌强模型不一定适合所有环节
只给 reviewer 看 diff0/5 发现 spec 被静默重定义只看代码差异会丢失上下文

最优配置组合:Opus 做 controller + 引导式 plan + 条件化 Haiku implementers + 极简 review 合约。每个任务成本从 $11.67–14.84 降到了 $6.24–$6.60,减半还有找零。

还有一个值得单独列出来的风险:只看 diff 的 reviewer 会自信地重新定义 spec——把「spec」理解成全局约束,而不是当前任务的需求。 5 个被测案例,0 个发现了缺少的 brief。如果你也在用类似的 review 流程,这个坑值得留意。


验证阶段出了个小插曲

第一批 Anthropic eval 数据非常漂亮——36 小时的实验,花费约 $650,换来了 50% 更快、60% 更省。

然后他们在 Codex 上跑了一遍。没有任何改善。

Jesse 心里一凉。几分钟后找到原因:Codex 的 eval 环境没有跟宿主 OS 充分隔离。他们一直在 benchmark Superpowers 5.1.0

修复隔离问题后再跑——一切成立。

终端里的 eval 对比结果:优化版 vs dev-HEAD vs main-HEAD(5.1.0)

这个插曲本身就是一条经验:数据好看的时候,先确认你在测的是你要测的东西。


45 小时的实验比产品更新更值钱

Superpowers 本身就是让 agent 自主开发的框架。而它用 Fable 优化自己的过程,正好是它理念的最佳演示。Jesse 在官博上写了一句:“我们很骄傲这台机器和它的机器人伙伴一起完成了这次改进。”

这 45 个小时里,Jesse 花在指导 Fable 上的时间远不到 45 小时。它自己搭研究框架、提假设、验证、记录日志。甚至在测量自己的成果时会发现并纠正 Jesse 的 bug。

这不是一段「AI 帮我写代码」的报道。这是一段「AI 自主优化代码开发流程」的真实记录——你把框架用 AI 来开发,这个框架又用 AI 来优化自己。这个循环第一次跑通了。

写到这儿我想问你一句:在你的团队里,code review 只看 diff 还是连上下文一起看?

如果觉得这篇文章有帮助,欢迎点赞、在看、转发!有问题也可以在评论区留言,我会尽量回复!


内容效果不满意?点此反馈

输入关键词开始搜索