三大AI工程框架暗战:gstack(10.7万)、superpowers(21万)、gsd(6.9万) 只有一个真的适合你
公众号名称:老邢的开源笔记
作者名称:老邢的开源笔记
发布时间:2026-06-05 19:47

我帮你把 gstack、superpowers、gsd 这三个框架摸了个遍,把坑也踩完了。
上周跟一个朋友吃饭,他是某大厂的高级工程师,说最近用 Claude Code 写代码写得飞起,问我用没用过什么”框架”加持。
我说用过三个,他说那你给我推荐一个。
我没直接说,因为我知道他跟我的情况不一样——他带着5个人,要协作;我一个人单打独斗。这三个框架,适合的人完全不同。
今天就把我的判断系统地说一遍。
一、基础信息
1. 三个项目是谁做的,背景如何

gstack | github.com/garrytan/gstack[1]
⭐ 107,264 stars
作者是 Garry Tan,现任 Y Combinator CEO。他不是那种只会布道的人——Palantir 早期工程师出身,创过 Posterous(卖给了 Twitter),亲手看着 Coinbase、Instacart、Rippling 从车库长出来。
gstack 本质上是他自己用的 Claude Code 配置,对外公开的。他在 README 里说过一句话,大意是:过去 60 天里,他一边做 YC 的全职工作,一边用这套系统发了 3 个生产服务和 40 多个功能,“2026 年的逻辑代码产出速度是 2013 年的 810 倍”。
信不信由你,但这个背景本身就说明这套工具是在真实生产压力下跑过的,不是 demo 货。
superpowers | github.com/obra/superpowers[2]
⭐ 218,511 stars(三者最高)
作者是 Jesse Vincent,Berkeley 技术圈的老人,Prime Radiant 联合创始人,fsck.com 的博主。他本人是严肃的工程师,不是那种追热点的人。
superpowers 的核心理念非常明确:让 AI 在开始写代码前,先老老实实把需求、设计、计划走一遍。听起来简单,但绝大多数人跟 AI 协作的方式恰恰相反——想到哪说到哪,然后被一堆乱代码埋掉。
218k star 这个数字本身说明了问题:它戳中了很多人的痛点。
get-shit-done / gsd-core | github.com/gsd-build/get-shit-done[3](已归档,迁移至 open-gsd/gsd-core[4])
⭐ 原始仓库 63,900 stars(已归档),新仓库 2,800 stars
出品方是 TÂCHES 团队,后来移交给了 open-gsd 社区组织。名字就叫”把事情他妈做完”,很难不喜欢。
这个项目解决的问题是三个里最技术向的:上下文腐烂(context rot)。就是你跟 AI 聊着聊着,它越来越蠢,因为上下文窗口被填满了,质量在悄无声息地降级。GSD 的解法是把所有繁重工作扔给全新启动的子 Agent,主会话保持干净。
2. 这三个项目在干同一件事
表面上看三者方向各异,但本质都在解决同一个问题:原生 Claude Code 没有约束,AI 会胡来。
它们共同提供的能力:
•强迫 AI 在动手前先想清楚(讨论 → 规划 → 执行 → 验证)•把大任务分解给子 Agent 并行执行•内置代码审查流程,防止”AI 说完成了但其实没验证”•兼容多个 AI 编码工具(Claude Code、Cursor、Codex 等)•全部 MIT 开源,零付费门槛
二、能力对比

1. 运行平台和安装
三个项目安装体验差距挺大。
superpowers 最省心,直接在 Claude Code 里一行命令:
/plugin install superpowers@claude-plugins-official
支持 8 个平台,包括 Gemini CLI、GitHub Copilot CLI。
GSD 次之,用 npx 一键安装,有交互式向导引导你选运行时:
npx @opengsd/gsd-core@latest
支持 8 个以上平台,包括 Windsurf、Kilo。
gstack 相对麻烦一点,得先装 Bun(v1.0+),然后 clone 仓库跑脚本:
git clone --depth 1 https://github.com/garrytan/gstack.git ~/.claude/skills/gstack && cd ~/.claude/skills/gstack && ./setup
好在它有 --team 参数,团队用的话可以把配置提交进 git 仓库,保证所有人用同一版本。支持 10 个平台,是三者中最多的。
| gstack | superpowers | GSD | |
|---|---|---|---|
| 安装难度 | 🟡 需装 Bun | 🟢 插件一键 | 🟢 npx 向导 |
| 支持平台数 | 10 个(最多) | 8 个 | 8+ 个 |
| 团队分发 | ✅ git 提交同步 | ✅ 仓库共享 | ✅ 局部安装 |

2. 上下文管理
这是三者差距最明显的地方。
GSD 是专门为这个问题而生的。它的核心设计就是:执行阶段的每个子 Agent 从 200k token 的全新上下文启动,主会话永远保持轻量。跨会话的记忆通过 STATE.md、CONTEXT.md 这些结构化文件持久化——不依赖 AI 的记忆,而是写进文件系统。
gstack 靠的是 GBrain,本地用 PGLite,云端用 Supabase,持久化记忆跨会话存活。有意思的地方是它可以配合 Conductor 同时跑 10-15 个并行 sprint,上下文压力被物理分散了。
superpowers 在这一块是三者中最朴素的——它依赖 Git Worktree 隔离,没有专门的记忆机制,但换个角度看,它的哲学是”每次都在干净的基础上开始”,某种程度上也规避了上下文污染。
| gstack | superpowers | GSD | |
|---|---|---|---|
| 上下文隔离 | 并行 sprint 物理分散 | Git Worktree 隔离 | 🏆 子 Agent 全新 200k 上下文 |
| 跨会话记忆 | GBrain(PGLite/Supabase) | ❌ 无专门机制 | 🏆 STATE.md 等结构化文件 |
| 腐烂防护 | 🟡 间接 | 🟡 部分 | 🏆 核心卖点 |
3. 工程纪律
说白了就是:这套框架能不能管住 AI 乱来?
superpowers 是三者中最严格的。它的技能会自动触发,不需要你手动调——AI 在写代码前,系统会强制走需求澄清、计划审查、代码实现的完整链路。TDD 是硬约束:先写失败的测试,再写代码,测试前写的实现代码会被删掉。Critical 级别的问题会直接阻断后续进度,不是说说而已。
gstack 的约束更像工具箱——23 个斜杠命令摆在那,你随时可以调用 /plan-eng-review、/review、/qa,但没人强迫你必须用。这种自由对有经验的人来说是效率优势,对新人来说可能是把双刃剑。
GSD 在中间——五步循环(Discuss → Plan → Execute → Verify → Ship)有明确结构,每个阶段有专属命令,框架感很强,但相比 superpowers 的”强制触发”,还是更多靠自觉。
| gstack | superpowers | GSD | |
|---|---|---|---|
| 流程强制性 | 🟡 工具可选 | 🏆 自动触发 | 🟡 结构清晰但靠自觉 |
| TDD 执行 | 🟡 命令支持 | 🏆 硬约束 | 🟡 Verify 阶段验证 |
| 审查门控 | 🟡 手动调用 | 🏆 自动,Critical 阻断 | 🟡 Verify+Ship 阶段 |
4. 安全性

这里 gstack 是单独一档。
它内置了三层提示注入防护:22MB 的 ML 分类器 + Claude Haiku 二次校验 + 随机金丝雀 token。还有专门的 /cso 命令,跑 OWASP Top 10 + STRIDE 威胁模型,17 条误报排除规则。
superpowers 和 GSD 在安全上都没有特别设计,属于”安全中性”——你自己负责,框架不干预。
如果你在做 ToB 业务或者处理敏感数据,gstack 的这套安全机制是有实际价值的,其余两个在这块基本交白卷。
三、实战对比
1. 上手难度:命令多不多,聪不聪明
GSD 命令最多,50+ 个,但组织得很好,6 个命名空间(/gsd-workflow、/gsd-quality、/gsd-context 等)把功能归了类,加上完整的 Diataxis 四层文档(教程/操作指南/参考/解释),上手路径清晰。还支持中文文档,对国内用户友好。
superpowers 命令最少(约 12 个),而且大部分会自动触发,不需要记命令——这是它最聪明的地方。对于不想学一堆新命令的人来说,装上就能用。
gstack 中间,23 个命令,每个都对应一个虚拟角色(CEO、设计师、QA 负责人……),逻辑自洽,但需要花时间理解每个角色干什么,有一定学习成本。
| gstack | superpowers | GSD | |
|---|---|---|---|
| 命令数量 | 23+ | ~12 | 50+ |
| 是否智能触发 | ❌ 手动 | 🏆 自动 | ❌ 手动 |
| 文档质量 | 良 | 良 | 🏆 最完整 |
| 中文支持 | ❌ | ❌ | 🏆 原生中文 |
2. 新项目开始
三者都有”新建项目”的入口,但侧重点完全不同。
gstack 的路径是 /office-hours(6 个逼你重新审视产品假设的问题)→ /plan-ceo-review(商业视角拍板)→ /plan-eng-review(架构设计,含 ASCII 图表)。有点像你雇了一个产品经理和一个架构师陪你把项目想清楚。
superpowers 自动走 brainstorming(苏格拉底式挖需求,找到你真正想要的而不是你说的)→ writing-plans(2-5 分钟粒度的任务分解),整个过程流畅,适合不想折腾的人。
GSD 是 /gsd-new-project,一条命令生成 PROJECT.md、REQUIREMENTS.md、ROADMAP.md、STATE.md 等完整项目档案,有参数 --auto @file.md 支持从现有需求文档导入。适合做里程碑式项目管理的团队。
3. 历史项目迭代
这块 GSD 有天然优势——它的 /gsd-resume-work 命令可以从上次会话恢复完整上下文,STATE.md 记录了当前进度,continue-here.md 是明确的断点标记。接手一个自己两周没碰的项目,或者新人来接手,这套机制非常顺手。
gstack 靠 GBrain 记忆,但这依赖持久化服务是否正常工作。
superpowers 在历史项目迭代上相对弱——它更擅长从零开始做新任务,对”恢复上次进度”这个场景没有专门设计。
4. 代码 Review
gstack 的 /review 命令有个我觉得很赞的设计——它专门去找”能通过 CI 但会在生产环境炸掉的 bug”,不是一般的格式检查。还有 /codex 命令,可以调 OpenAI Codex CLI 来做独立的第二视角审查,防止 Claude 的盲点。
superpowers 的 review 分级明确,Critical/Major/Minor 分开报,Critical 直接卡住不让走下一步,工程纪律拉满。
GSD 的 /gsd-code-review 有 --depth 参数(quick/standard/deep),还支持 --fix 自动修复,甚至可以调多个 AI 并行 review:/gsd-review --all 可以同时发给 Gemini、Codex、Cursor、Qwen 等做交叉验证,这是三者里最有想象力的 review 机制。
| gstack | superpowers | GSD | |
|---|---|---|---|
| Review 深度 | 🏆 找生产级 Bug | 严重程度分级 | 多 AI 交叉验证 |
| 第二视角 | 🏆 /codex 调 OpenAI | ❌ | 🏆 支持 Gemini/Codex/Cursor 等 |
| 自动修复 | ✅ 明显问题自动修 | ❌ | ✅ —fix 参数 |
5. 前后端功能测试
gstack 在这里遥遥领先,没有悬念。
/browse 和 /qa 调的是真实 Playwright Chromium,不是模拟器,真实点击、真实渲染,速度大概 100ms 每个操作。还有 /ios-qa,通过 USB CoreDevice 直接跑真机 iPhone 测试。这是其余两个完全没有的能力。
superpowers 和 GSD 都没有内置浏览器自动化,前后端测试依赖你自己的测试框架——superpowers 靠 TDD 约束你提前写测试,GSD 靠 Verify 步骤走查验收,但都不会自己点开浏览器给你跑。
如果你的项目有前端,gstack 的这套工具链优势是碾压级的。
6. 团队协作多模块场景
gstack 有 --team 模式,配置提交进 git 仓库,团队自动同步版本,23 个角色分工协作,/autoplan 自动把 CEO → 设计 → 工程审查串起来。对于想把 AI 工作流标准化的团队很实用。
GSD 的 /gsd-workstreams 支持多工作流管理,/gsd-workspace 支持 git worktree 或 clone 策略,对多模块并发开发有专门支持。
superpowers 靠 dispatching-parallel-agents 和 subagent-driven-development 技能来做并行调度,原理清晰但没有专门的”团队模式”概念。
7. 多任务并行开发
gstack 配合 Conductor 最多可以同时跑 10-15 个并行 sprint,是三者中并行上限最高的。
GSD 用执行波次(execution waves)机制并行,每个执行者独立 200k token 上下文,互不干扰。
superpowers 的 dispatching-parallel-agents 任务粒度最细(2-5 分钟的小任务),适合精细化并行,但并行上限不如 gstack 激进。
四、对比结论

老实说,这三个框架没有高下之分,只有适不适合。
选 superpowers(218k ⭐)
如果你是这样的人:
•刚开始用 AI 编程,不知道怎么约束它•团队里有”AI 写完我不敢放心上线”的问题•不想学一堆命令,希望框架自己动•追求严格的 TDD 和测试覆盖率
选 gstack(107k ⭐)
如果你是这样的人:
•一个人做产品,需要 AI 充当你的产品经理、设计师、QA 团队•项目有前端,需要真实浏览器测试•有安全合规要求(OWASP、STRIDE)•想并行跑最多 sprint,极限榨干 AI 的产出
不适合你如果:•你的团队只做后端,用不到浏览器测试和设计评审•你觉得 23 个命令学起来太累
选 GSD(原始 64k ⭐,新仓库 2.8k ⭐)
如果你是这样的人:
•经常遇到 AI 越聊越蠢、上下文腐烂的问题•做中大型项目,需要里程碑管理•需要从多个 AI 获取交叉验证的 review 意见•中文用户,或者团队需要本地化文档
需要注意:
•新仓库(gsd-core)才两周多,生态还不稳定•命令 50+ 个,上手需要花时间

三句话总结:
superpowers = 给 AI 套上工程纪律的枷锁,适合”管住 AI”的场景
gstack = 把 AI 变成你的虚拟团队,适合”一人当多人用”的场景
GSD = 解决 AI 越跑越蠢的上下文问题,适合”大型项目持久战”的场景
项目链接:
| 项目 | 链接 |
|---|---|
| gstack | github.com/garrytan/gstack[5] |
| superpowers | github.com/obra/superpowers[6] |
| get-shit-done(归档) | github.com/gsd-build/get-shit-done[7] |
| gsd-core(活跃) | github.com/open-gsd/gsd-core[8] |
| superpowers 官网 | primeradiant.com/superpowers[9] |
| gsd-core 官网 | opengsd.net[10] |
你现在在用哪个?或者你觉得这三个都不如直接裸 Claude Code 来得自在?评论区说说。
References
[1] github.com/garrytan/gstack:https://github.com/garrytan/gstack
[2]github.com/obra/superpowers:https://github.com/obra/superpowers
[3]github.com/gsd-build/get-shit-done:https://github.com/gsd-build/get-shit-done
[4]open-gsd/gsd-core:https://github.com/open-gsd/gsd-core
[5]github.com/garrytan/gstack:https://github.com/garrytan/gstack
[6]github.com/obra/superpowers:https://github.com/obra/superpowers
[7]github.com/gsd-build/get-shit-done:https://github.com/gsd-build/get-shit-done
[8]github.com/open-gsd/gsd-core:https://github.com/open-gsd/gsd-core
[9]primeradiant.com/superpowers:https://primeradiant.com/superpowers/
[10]opengsd.net: https://opengsd.net
内容效果不满意?点此反馈