Clipping 微信公众号

三大AI工程框架暗战:gstack(10.7万)、superpowers(21万)、gsd(6.9万) 只有一个真的适合你

by 老邢的开源笔记 原文 ↗
Created: 2026-06-06

公众号名称:老邢的开源笔记

作者名称:老邢的开源笔记

发布时间:2026-06-05 19:47

我帮你把 gstack、superpowers、gsd 这三个框架摸了个遍,把坑也踩完了。


上周跟一个朋友吃饭,他是某大厂的高级工程师,说最近用 Claude Code 写代码写得飞起,问我用没用过什么”框架”加持。

我说用过三个,他说那你给我推荐一个。

我没直接说,因为我知道他跟我的情况不一样——他带着5个人,要协作;我一个人单打独斗。这三个框架,适合的人完全不同。

今天就把我的判断系统地说一遍。


一、基础信息

1. 三个项目是谁做的,背景如何

gstack | github.com/garrytan/gstack[1]

107,264 stars

作者是 Garry Tan,现任 Y Combinator CEO。他不是那种只会布道的人——Palantir 早期工程师出身,创过 Posterous(卖给了 Twitter),亲手看着 Coinbase、Instacart、Rippling 从车库长出来。

gstack 本质上是他自己用的 Claude Code 配置,对外公开的。他在 README 里说过一句话,大意是:过去 60 天里,他一边做 YC 的全职工作,一边用这套系统发了 3 个生产服务和 40 多个功能,“2026 年的逻辑代码产出速度是 2013 年的 810 倍”。

信不信由你,但这个背景本身就说明这套工具是在真实生产压力下跑过的,不是 demo 货。


superpowers | github.com/obra/superpowers[2]

218,511 stars(三者最高)

作者是 Jesse Vincent,Berkeley 技术圈的老人,Prime Radiant 联合创始人,fsck.com 的博主。他本人是严肃的工程师,不是那种追热点的人。

superpowers 的核心理念非常明确:让 AI 在开始写代码前,先老老实实把需求、设计、计划走一遍。听起来简单,但绝大多数人跟 AI 协作的方式恰恰相反——想到哪说到哪,然后被一堆乱代码埋掉。

218k star 这个数字本身说明了问题:它戳中了很多人的痛点。


get-shit-done / gsd-core | github.com/gsd-build/get-shit-done[3](已归档,迁移至 open-gsd/gsd-core[4])

⭐ 原始仓库 63,900 stars(已归档),新仓库 2,800 stars

出品方是 TÂCHES 团队,后来移交给了 open-gsd 社区组织。名字就叫”把事情他妈做完”,很难不喜欢。

这个项目解决的问题是三个里最技术向的:上下文腐烂(context rot)。就是你跟 AI 聊着聊着,它越来越蠢,因为上下文窗口被填满了,质量在悄无声息地降级。GSD 的解法是把所有繁重工作扔给全新启动的子 Agent,主会话保持干净。


2. 这三个项目在干同一件事

表面上看三者方向各异,但本质都在解决同一个问题:原生 Claude Code 没有约束,AI 会胡来

它们共同提供的能力:

•强迫 AI 在动手前先想清楚(讨论 → 规划 → 执行 → 验证)•把大任务分解给子 Agent 并行执行•内置代码审查流程,防止”AI 说完成了但其实没验证”•兼容多个 AI 编码工具(Claude Code、Cursor、Codex 等)•全部 MIT 开源,零付费门槛


二、能力对比

1. 运行平台和安装

三个项目安装体验差距挺大。

superpowers 最省心,直接在 Claude Code 里一行命令:

/plugin install superpowers@claude-plugins-official

支持 8 个平台,包括 Gemini CLI、GitHub Copilot CLI。

GSD 次之,用 npx 一键安装,有交互式向导引导你选运行时:

npx @opengsd/gsd-core@latest

支持 8 个以上平台,包括 Windsurf、Kilo。

gstack 相对麻烦一点,得先装 Bun(v1.0+),然后 clone 仓库跑脚本:

git clone --depth 1 https://github.com/garrytan/gstack.git ~/.claude/skills/gstack && cd ~/.claude/skills/gstack && ./setup

好在它有 --team 参数,团队用的话可以把配置提交进 git 仓库,保证所有人用同一版本。支持 10 个平台,是三者中最多的。


gstacksuperpowersGSD
安装难度🟡 需装 Bun🟢 插件一键🟢 npx 向导
支持平台数10 个(最多)8 个8+ 个
团队分发✅ git 提交同步✅ 仓库共享✅ 局部安装

2. 上下文管理

这是三者差距最明显的地方。

GSD 是专门为这个问题而生的。它的核心设计就是:执行阶段的每个子 Agent 从 200k token 的全新上下文启动,主会话永远保持轻量。跨会话的记忆通过 STATE.mdCONTEXT.md 这些结构化文件持久化——不依赖 AI 的记忆,而是写进文件系统。

gstack 靠的是 GBrain,本地用 PGLite,云端用 Supabase,持久化记忆跨会话存活。有意思的地方是它可以配合 Conductor 同时跑 10-15 个并行 sprint,上下文压力被物理分散了。

superpowers 在这一块是三者中最朴素的——它依赖 Git Worktree 隔离,没有专门的记忆机制,但换个角度看,它的哲学是”每次都在干净的基础上开始”,某种程度上也规避了上下文污染。


gstacksuperpowersGSD
上下文隔离并行 sprint 物理分散Git Worktree 隔离🏆 子 Agent 全新 200k 上下文
跨会话记忆GBrain(PGLite/Supabase)❌ 无专门机制🏆 STATE.md 等结构化文件
腐烂防护🟡 间接🟡 部分🏆 核心卖点

3. 工程纪律

说白了就是:这套框架能不能管住 AI 乱来?

superpowers 是三者中最严格的。它的技能会自动触发,不需要你手动调——AI 在写代码前,系统会强制走需求澄清、计划审查、代码实现的完整链路。TDD 是硬约束:先写失败的测试,再写代码,测试前写的实现代码会被删掉。Critical 级别的问题会直接阻断后续进度,不是说说而已。

gstack 的约束更像工具箱——23 个斜杠命令摆在那,你随时可以调用 /plan-eng-review/review/qa,但没人强迫你必须用。这种自由对有经验的人来说是效率优势,对新人来说可能是把双刃剑。

GSD 在中间——五步循环(Discuss → Plan → Execute → Verify → Ship)有明确结构,每个阶段有专属命令,框架感很强,但相比 superpowers 的”强制触发”,还是更多靠自觉。


gstacksuperpowersGSD
流程强制性🟡 工具可选🏆 自动触发🟡 结构清晰但靠自觉
TDD 执行🟡 命令支持🏆 硬约束🟡 Verify 阶段验证
审查门控🟡 手动调用🏆 自动,Critical 阻断🟡 Verify+Ship 阶段

4. 安全性

这里 gstack 是单独一档。

它内置了三层提示注入防护:22MB 的 ML 分类器 + Claude Haiku 二次校验 + 随机金丝雀 token。还有专门的 /cso 命令,跑 OWASP Top 10 + STRIDE 威胁模型,17 条误报排除规则。

superpowers 和 GSD 在安全上都没有特别设计,属于”安全中性”——你自己负责,框架不干预。

如果你在做 ToB 业务或者处理敏感数据,gstack 的这套安全机制是有实际价值的,其余两个在这块基本交白卷。


三、实战对比

1. 上手难度:命令多不多,聪不聪明

GSD 命令最多,50+ 个,但组织得很好,6 个命名空间(/gsd-workflow/gsd-quality/gsd-context 等)把功能归了类,加上完整的 Diataxis 四层文档(教程/操作指南/参考/解释),上手路径清晰。还支持中文文档,对国内用户友好。

superpowers 命令最少(约 12 个),而且大部分会自动触发,不需要记命令——这是它最聪明的地方。对于不想学一堆新命令的人来说,装上就能用。

gstack 中间,23 个命令,每个都对应一个虚拟角色(CEO、设计师、QA 负责人……),逻辑自洽,但需要花时间理解每个角色干什么,有一定学习成本。


gstacksuperpowersGSD
命令数量23+~1250+
是否智能触发❌ 手动🏆 自动❌ 手动
文档质量🏆 最完整
中文支持🏆 原生中文

2. 新项目开始

三者都有”新建项目”的入口,但侧重点完全不同。

gstack 的路径是 /office-hours(6 个逼你重新审视产品假设的问题)→ /plan-ceo-review(商业视角拍板)→ /plan-eng-review(架构设计,含 ASCII 图表)。有点像你雇了一个产品经理和一个架构师陪你把项目想清楚。

superpowers 自动走 brainstorming(苏格拉底式挖需求,找到你真正想要的而不是你说的)→ writing-plans(2-5 分钟粒度的任务分解),整个过程流畅,适合不想折腾的人。

GSD 是 /gsd-new-project,一条命令生成 PROJECT.mdREQUIREMENTS.mdROADMAP.mdSTATE.md 等完整项目档案,有参数 --auto @file.md 支持从现有需求文档导入。适合做里程碑式项目管理的团队。


3. 历史项目迭代

这块 GSD 有天然优势——它的 /gsd-resume-work 命令可以从上次会话恢复完整上下文,STATE.md 记录了当前进度,continue-here.md 是明确的断点标记。接手一个自己两周没碰的项目,或者新人来接手,这套机制非常顺手。

gstack 靠 GBrain 记忆,但这依赖持久化服务是否正常工作。

superpowers 在历史项目迭代上相对弱——它更擅长从零开始做新任务,对”恢复上次进度”这个场景没有专门设计。


4. 代码 Review

gstack 的 /review 命令有个我觉得很赞的设计——它专门去找”能通过 CI 但会在生产环境炸掉的 bug”,不是一般的格式检查。还有 /codex 命令,可以调 OpenAI Codex CLI 来做独立的第二视角审查,防止 Claude 的盲点。

superpowers 的 review 分级明确,Critical/Major/Minor 分开报,Critical 直接卡住不让走下一步,工程纪律拉满。

GSD 的 /gsd-code-review--depth 参数(quick/standard/deep),还支持 --fix 自动修复,甚至可以调多个 AI 并行 review:/gsd-review --all 可以同时发给 Gemini、Codex、Cursor、Qwen 等做交叉验证,这是三者里最有想象力的 review 机制。


gstacksuperpowersGSD
Review 深度🏆 找生产级 Bug严重程度分级多 AI 交叉验证
第二视角🏆 /codex 调 OpenAI🏆 支持 Gemini/Codex/Cursor 等
自动修复✅ 明显问题自动修✅ —fix 参数

5. 前后端功能测试

gstack 在这里遥遥领先,没有悬念。

/browse/qa 调的是真实 Playwright Chromium,不是模拟器,真实点击、真实渲染,速度大概 100ms 每个操作。还有 /ios-qa,通过 USB CoreDevice 直接跑真机 iPhone 测试。这是其余两个完全没有的能力。

superpowers 和 GSD 都没有内置浏览器自动化,前后端测试依赖你自己的测试框架——superpowers 靠 TDD 约束你提前写测试,GSD 靠 Verify 步骤走查验收,但都不会自己点开浏览器给你跑。

如果你的项目有前端,gstack 的这套工具链优势是碾压级的。


6. 团队协作多模块场景

gstack 有 --team 模式,配置提交进 git 仓库,团队自动同步版本,23 个角色分工协作,/autoplan 自动把 CEO → 设计 → 工程审查串起来。对于想把 AI 工作流标准化的团队很实用。

GSD 的 /gsd-workstreams 支持多工作流管理,/gsd-workspace 支持 git worktree 或 clone 策略,对多模块并发开发有专门支持。

superpowers 靠 dispatching-parallel-agentssubagent-driven-development 技能来做并行调度,原理清晰但没有专门的”团队模式”概念。


7. 多任务并行开发

gstack 配合 Conductor 最多可以同时跑 10-15 个并行 sprint,是三者中并行上限最高的。

GSD 用执行波次(execution waves)机制并行,每个执行者独立 200k token 上下文,互不干扰。

superpowers 的 dispatching-parallel-agents 任务粒度最细(2-5 分钟的小任务),适合精细化并行,但并行上限不如 gstack 激进。


四、对比结论

老实说,这三个框架没有高下之分,只有适不适合。


选 superpowers(218k ⭐)

如果你是这样的人:

•刚开始用 AI 编程,不知道怎么约束它•团队里有”AI 写完我不敢放心上线”的问题•不想学一堆命令,希望框架自己动•追求严格的 TDD 和测试覆盖率


选 gstack(107k ⭐)

如果你是这样的人:

•一个人做产品,需要 AI 充当你的产品经理、设计师、QA 团队•项目有前端,需要真实浏览器测试•有安全合规要求(OWASP、STRIDE)•想并行跑最多 sprint,极限榨干 AI 的产出

不适合你如果:•你的团队只做后端,用不到浏览器测试和设计评审•你觉得 23 个命令学起来太累


选 GSD(原始 64k ⭐,新仓库 2.8k ⭐)

如果你是这样的人:

•经常遇到 AI 越聊越蠢、上下文腐烂的问题•做中大型项目,需要里程碑管理•需要从多个 AI 获取交叉验证的 review 意见•中文用户,或者团队需要本地化文档

需要注意:

•新仓库(gsd-core)才两周多,生态还不稳定•命令 50+ 个,上手需要花时间


三句话总结:

superpowers = 给 AI 套上工程纪律的枷锁,适合”管住 AI”的场景

gstack = 把 AI 变成你的虚拟团队,适合”一人当多人用”的场景

GSD = 解决 AI 越跑越蠢的上下文问题,适合”大型项目持久战”的场景


项目链接:

项目链接
gstackgithub.com/garrytan/gstack[5]
superpowersgithub.com/obra/superpowers[6]
get-shit-done(归档)github.com/gsd-build/get-shit-done[7]
gsd-core(活跃)github.com/open-gsd/gsd-core[8]
superpowers 官网primeradiant.com/superpowers[9]
gsd-core 官网opengsd.net[10]

你现在在用哪个?或者你觉得这三个都不如直接裸 Claude Code 来得自在?评论区说说。

References

[1] github.com/garrytan/gstack:https://github.com/garrytan/gstack
[2]github.com/obra/superpowers:https://github.com/obra/superpowers
[3]github.com/gsd-build/get-shit-done:https://github.com/gsd-build/get-shit-done
[4]open-gsd/gsd-core:https://github.com/open-gsd/gsd-core
[5]github.com/garrytan/gstack:https://github.com/garrytan/gstack
[6]github.com/obra/superpowers:https://github.com/obra/superpowers
[7]github.com/gsd-build/get-shit-done:https://github.com/gsd-build/get-shit-done
[8]github.com/open-gsd/gsd-core:https://github.com/open-gsd/gsd-core
[9]primeradiant.com/superpowers:https://primeradiant.com/superpowers/
[10]opengsd.net: https://opengsd.net


内容效果不满意?点此反馈

输入关键词开始搜索