Clipping X

GPT-5.6 模型太多不会选?直接复制我这套 Codex 最佳配置

by @zjp1997720 原文 ↗ 原载于 2026-07-11
Created: 2026-07-11

图像

图像

GPT-5.6 发布后,Codex 的模型选择一下子变复杂了。

Sol、Terra、Luna 到底怎么选?Low、Medium、High、Extra High、Max、Ultra 六档推理强度又有什么区别?Ultra 既然最强,是不是复杂任务就应该直接拉满?

我最近花了不少时间查榜单、看 X 上的实测,也亲自踩了一个非常贵的坑。最后,我把自己的 Codex 调整成了下面这套配置。

如果你懒得研究,直接抄作业:

  • 主 Agent:默认使用 GPT-5.6 Sol + High
  • 简单任务:手动切到 Medium
  • 极复杂任务:手动切到 Extra High
  • Max 和 Ultra:直接在设置里关闭
  • LazyCodex 负责自动分配子 Agent:检索和执行型工作交给 Luna,关键判断、规划和审查交给 Sol
  • Terra:退出我的默认配置,需要时再单独调用

这样配置以后,我平时只需要判断当前任务用 Medium、High 还是 Extra High。子 Agent 应该用什么模型、开多少推理强度,交给 LazyCodex 自动处理。

文章最后,我放了一段可以直接复制给 Codex 的提示词。它会自动安装或更新 LazyCodex,并一次性完成角色配置。

一次 Ultra,把我的 5 小时额度直接烧光

先说我为什么强烈建议大家关闭 Ultra。

前一天,我只是让 Codex 修一个「模型选项无法更改」的配置问题。当时主模型用的是价格低于 Sol 的 Terra Ultra。

结果任务跑了一个多小时,问题还没有完整解决,我的 5 小时用量已经归零。

界面里同时出现了官方警告:Ultra 最多可能使用 1000 个 Agents,并且会快速消耗用量额度。

图像

Ultra 的问题不只在于「多开几个子 Agent」。Codex 的子 Agent 还可以继续向下派遣新的子 Agent,调用数量会递归放大。

更关键的是,目前 Codex 官方这套 Multi-Agent 机制里,子 Agent 默认继承主 Agent 的模型和推理强度。主 Agent 如果是 Sol Ultra,派出去的子 Agent 通常也是 Sol Ultra。你没有一个简单的入口,为每类子任务单独指定更便宜的模型。

图像

这次任务最后留下了 17 个已经结束的子 Agent。5 小时额度剩余 0%,周额度只剩 40%。

图像

这个消耗会直接反映在 Pro 用户每天都能看到的使用额度里。对大多数人来说,Ultra 潜在的能力上限收益,抵不上它造成的额度失控风险。

X 上也已经有人遇到了相同问题。Theo 公开反馈,自己开启 Sol Ultra 后,子 Agent 同样继承了 Sol Ultra,几个 Agent 就能迅速烧掉一周额度。查看原帖

所以我的结论很直接:Ultra 目前更像压力测试入口,不适合作为日常工作模式。

GPT-5.6 的六档推理强度,到底该怎么选?

GPT-5.5 时代,大家熟悉的是 Low、Medium、High、Extra High 四档。GPT-5.6 又增加了 Max 和 Ultra。

你可以把它们简单理解成:

  • Low:速度优先,适合明确、机械的小任务
  • Medium:日常轻任务,速度和质量比较均衡
  • High:大多数复杂知识工作和编程任务的默认档
  • Extra High:复杂规划、疑难问题、关键交付前的深度处理
  • Max:在 Extra High 之上继续增加推理投入
  • Ultra:可以理解为 Max 再叠加 Codex 官方的 Multi-Agent 机制

这里最容易产生的误区,是把推理强度当成游戏画质:既然机器允许,就直接全部拉满。

实际上,推理强度越高,边际收益越小,消耗却会快速增加。从现有榜单看,Sol High 已经达到很强的水平;Extra High 还能带来一段明确提升;到了 Max,提升开始变得昂贵。

Max 并非完全没有价值。超大型项目的前期架构、非常复杂的研究设计、一次错误会造成很大损失的关键决策,可能值得临时开启。大部分 Pro 用户的日常任务,用到这里的机会很少。

我的使用习惯因此非常简单:

Sol High 常驻,简单任务降到 Medium,真正困难的任务升到 Extra High。Max 和 Ultra 默认不显示。

图像

为什么我的默认配置里没有 Terra?

这里要说清楚:Terra 不是一个不能用的模型。它的问题是,在目前的价格和能力曲线上,经常能被 Sol 或 Luna 替代。

Artificial Analysis 发布的 GPT-5.6 智能水平与任务成本图里,Sol 和 Luna 的各档位都位于 Terra 的更优位置。换句话说,对于同一档 Terra,往往能找到一个 Luna 或 Sol 档位,在不增加成本的情况下更聪明,或者用更低成本达到接近的能力。

图像

这也是 Artificial Analysis 给出的公开结论:Luna 和 Sol 始终领先于 Terra,Luna 尤其体现出很强的成本效率。阅读 GPT-5.6 分析查看原始 X 帖子

这里需要区分不同榜单回答的问题。

上面的 Intelligence Index 是多类智能任务的综合指数,适合判断模型的通用能力和单位任务成本。DeepSWE 更聚焦真实软件工程:Agent 需要理解代码库、修改代码并完成验证。它覆盖 113 个任务,比单轮编程问答更接近我们在 Codex 里实际修 Bug、改功能的过程。对于编程场景,我会给 DeepSWE 更高的参考权重。

DeepSWE 的成本曲线里,Sol High 达到 69%,平均每个任务 3.47 美元;Sol Medium 达到 61%,平均成本 1.86 美元。High 已经站在非常强的能力区间,这也是我不建议普通用户默认开启 Max 的直接依据。

展开全部推理档位后,还能看到几组很有代表性的对比:

  • Terra Medium:35%,平均成本 0.58 美元
  • Luna High:44%,平均成本 0.78 美元
  • Terra Extra High:60%,平均成本 2.13 美元
  • Sol Medium:61%,平均成本 1.86 美元
  • Terra Max:70%,平均成本 4.95 美元
  • Sol Extra High:71%,平均成本 4.70 美元

这几组数据不能证明 Terra 在所有任务里都更差,却足以说明:如果我们要设计一套简单、稳定、适合大多数人的默认配置,Sol + Luna 已经覆盖了主要区间,没必要再增加一个需要用户反复权衡的 Terra。

图像

查看 Coding Agent Index 完整榜单

榜单负责告诉我们模型在标准化任务里的能力和成本;X 上的用户反馈负责暴露真实产品行为;我自己的事故则说明这种行为会怎样影响 Pro 额度。三类证据放在一起,才足以支撑一套日常配置。

模型大小和推理强度,是两个不同的旋钮

Sol、Terra、Luna 的差异,确实与模型大小有关。

OpenAI 没有公布三个模型具体有多少参数,但官方将它们称为三个不同的模型尺寸,并把 Sol 定位为旗舰、能力最强的型号;Terra 主打能力、速度和成本之间的平衡;Luna 是速度最快、成本最低的型号。查看 OpenAI 官方说明

官方的 GPT-5.6 System Card 还直接把 Terra 和 Luna 称为更小的模型,并指出更大的模型在复杂任务、避免编辑冲突和事实准确性上通常表现更好。查看 GPT-5.6 System Card

这可以帮助我们理解两个容易混在一起的概念。

模型大小决定的是基础能力和能力上限。 更大的模型通常更擅长同时处理多条约束、跨领域信息、长期规划和异常情况,也更适合承担主控、规划、审查和最终决策。

推理强度决定的是这一次调用愿意投入多少计算。 Medium、High、Extra High、Max 调整的是模型处理当前任务时的推理投入,并不会把 Luna 临时变成 Sol。现有榜单里 Sol Medium 可以超过 Terra Extra High,正好说明「模型能力」和「推理投入」不能混为一谈。

参数量本身也不能直接换算成智商、知识量或思考深度。模型最终表现还受训练数据、训练方法、模型架构、后训练和推理强度影响。我们可以把型号大小当成能力分层的信号,真正做配置时仍然要看官方定位和任务榜单。

因此,用 Sol 担任主 Agent 的依据很扎实。主 Agent 需要理解全局目标、拆解任务、决定调用谁、处理冲突并汇总结果。Luna 的速度和成本优势,则非常适合大量并行、边界清楚、结果容易验证的子任务。

图像

Sol 负责判断,Luna 负责跑腿

我最后采用的是一套很容易理解的分工。

Sol 放在主 Agent,以及真正需要判断力的岗位:规划、复杂执行、方案审查、代码审查和最终把关。

Luna 放在工作量大、可以并行、结果容易验证的岗位:搜索文件、查资料、跑测试、收集证据和执行明确步骤。

具体配置如下:

LazyCodex 角色模型与推理强度对应的实际工作
ExplorerLuna High在本地文件和项目中找线索
LibrarianLuna High查资料、读文档、整理外部证据
QA ExecutorLuna High跑测试、做验证、回报结果
ExecutorSol High完成需要综合判断的核心任务
MetisSol High拆解问题、识别遗漏和风险
PlanSol Extra High为复杂任务制定执行计划
MomusSol Extra High挑计划的问题、做高强度审查
Code/Clone/Gate ReviewersSol Extra High审查代码、交付质量和关键门槛

图像

这套分工也符合目前 X 上比较有代表性的实践:让 Sol Extra High 负责规划,让 Luna High 负责执行。查看 CJ Zafir 的配置

它同时适合两类任务。

做复杂知识工作时,Sol 可以负责研究框架、课程结构、Skill 设计和最终判断;Luna 可以同时搜索资料、阅读文档、核对来源、整理案例。

做编程任务时,Sol 可以负责架构、疑难修改和审查;Luna 可以负责探索代码库、查文档、跑测试和完成边界清晰的子任务。

为什么我仍然推荐 LazyCodex?

我之前推荐 LazyCodex,是因为 Codex 面对复杂任务时明明拥有子 Agent,却经常懒得主动使用。

那篇帖子获得了很高的流量,恰好说明这是很多人的共同痛点。

__XPOSTER_regle_IMAGE_11__

图像

GPT-5.6 上线后,Codex 官方显然也在解决这个问题。Ultra 给出的答案是:更主动地拆任务,更多地调用子 Agent,甚至允许子 Agent 继续向下派遣。

方向是对的,现阶段的默认资源分配还不够精细。

LazyCodex 的价值就在这里:它允许我们给不同角色指定不同的模型和推理强度。负责思考的角色用 Sol,负责搜索和执行的角色用 Luna。我们得到 Multi-Agent 的并行能力,同时把高价模型留给真正需要判断力的环节。

一条提示词,完成安装和配置

下面这段提示词面向 Codex Pro 用户。直接复制给 Codex 即可。

它不会替你修改全局主模型,也不会替你固定主 Agent 的推理强度。以后你只需要根据任务复杂度,在 Medium、High 和 Extra High 之间手动切换。

请帮我安装或更新 LazyCodex(OMO),官方仓库:
https://github.com/code-yeongyu/oh-my-openagent

目标:在保留我现有 Codex 配置的前提下,完成 LazyCodex 的最新版本安装/更新,并把 Multi-Agent 角色调整为下面这套 GPT-5.6 配置。

一、执行前
1. 先阅读仓库最新的 Codex 安装说明和本机现有配置,不要凭旧经验猜安装路径。
2. 备份 ~/.codex/config.toml 和本次需要修改的 ~/.codex/agents/*.toml 文件。
3. 保留我已有的权限、MCP、插件、Skills、Hooks、凭据和其他无关设置。

二、安装或更新
1. 如果尚未安装 LazyCodex,按官方最新方式安装。
2. 如果已经安装,更新到最新稳定版本,并运行官方提供的初始化/迁移流程。
3. 只修改当前实际生效的 Codex 配置和 Agent 文件,不修改插件缓存中的模板文件。

三、设置可见的推理强度
把 Codex Desktop 中可选择的推理强度限制为:
low、medium、high、xhigh

隐藏 max 和 ultra。
不要修改我的全局主模型,也不要修改我的全局默认推理强度。

四、配置 LazyCodex 角色
请根据本机实际存在的 Agent 文件和角色语义完成映射:

- Explorer:gpt-5.6-luna,high
- Librarian:gpt-5.6-luna,high
- QA Executor:gpt-5.6-luna,high
- Executor:gpt-5.6-sol,high
- Metis:gpt-5.6-sol,high
- Plan:gpt-5.6-sol,xhigh
- Momus:gpt-5.6-sol,xhigh
- Code Reviewer/Clone Reviewer/Gate Reviewer 等代码、复刻和质量门禁审查角色:gpt-5.6-sol,xhigh

如果某个角色在当前版本中已改名,请根据官方说明和角色职责映射到新名称;如果无法确认,先保持原样并在结果中说明,不要自行创造不存在的角色。

五、验证
1. 使用 TOML 解析器检查所有修改后的配置,确保语法有效。
2. 核对 gpt-5.6-sol 和 gpt-5.6-luna 是否存在于本机当前 Codex 模型目录。
3. 确认 LazyCodex 能正常加载,Agent 文件来自当前生效目录。
4. 输出一张“角色/修改前/修改后”的对照表。
5. 明确列出备份文件位置、LazyCodex 版本、验证结果,以及是否需要重启 Codex Desktop。

整个过程直接执行到验证完成。遇到与我现有配置冲突的内容时,优先保留现有配置,并在最终报告中说明冲突和处理方式。

LazyCodex 后续更新有可能重新生成部分角色文件。如果更新后发现模型配置被重置,重新运行这段提示词即可。

最后的建议

GPT-5.6 带来的最大变化,是我们拥有了更高的能力上限,也拥有了更快烧完额度的方法。

对大多数 Codex Pro 用户,我建议从这套习惯开始:

主模型用 Sol,默认 High;简单任务降到 Medium,困难任务升到 Extra High;关闭 Max 和 Ultra;用 LazyCodex 把子 Agent 自动分配给 Sol 和 Luna。

这样,你只需要做一个决定:当前任务究竟有多复杂。

剩下的模型选择和 Agent 分工,让系统自己完成。

输入关键词开始搜索