Wiki 实体

Claude Code 模型接入与选型

Created: 2026-07-03 Updated: 2026-07-03

本页从 [[wiki/entities/Claude Code]] 拆出,覆盖异构模型接入、CC vs Codex 选型、Opus 4.8 与 Dynamic Workflows、Fable 5、GLM-5.2。

模型接入越来越异构

  • 新增实践表明,Claude 生态并不只围着 Anthropic 模型转:有人在 Claude Desktop 接 DeepSeek-V4,也有人在 Claude Code 场景下测试 DeepSeek,结果提示缓存、上下文和代理行为会出现新的性能/成本问题。 [[raw/2026-04-29/DracoVibeCoding/如何在Claude Desktop里配置DeepSeek-V4.md|来源: 如何在Claude Desktop里配置DeepSeek-V4.md]] [[raw/2026-04-30/day253/Claude Code 接入DeepSeek|缓存暴涨 实测.md|来源: Claude Code 接入DeepSeek|缓存暴涨 实测.md]]
  • 这进一步说明 Claude Code 的价值越来越依赖 harness 与工作流,而不是只靠“内置哪个模型”。 [[raw/2026-04-28/白家杰/Harness Engineering实践心得:如何高效驾驭AI?.md|来源: Harness Engineering实践心得:如何高效驾驭AI?.md]] [[raw/2026-04-29/李泽宇的AI实验室/如何让Codex自主编码10小时,秘籍开源.md|来源: 如何让Codex自主编码10小时,秘籍开源.md]]

CC vs Codex:选型框架与用户画像(2026-05 新增)

金先森提出了一个实用的选型框架,把用户和工具的关系讲清楚了:

四类用户画像:许愿型(模糊需求,“帮我做一下”交出去的是愿望不是任务)→ 现场型(需要看过程能随时喊停)→ 派单型(会写边界条件、能验收结果)→ 调度型(按任务性质选择不同的工作方式)。画像不是固定的——同一个人在不同任务上可能是不同类型。[[raw/2026-05-21/金先森是朝鲜族阿/Claude Code还是Codex?老金告你怎么选!.md|来源: 金先森 CC vs Codex 用户画像]]

核心判断三步法:这个任务需要我看过程吗?→边界条件我写清楚了吗?→结果我能验收吗?三个问题依次过滤,自然落到合适的工具上。[[raw/2026-05-21/金先森是朝鲜族阿/Claude Code还是Codex?老金告你怎么选!.md|来源: 金先森 选型三步法]]

Claude Code 与 Codex 的本质区别:CC 是”现场协作”——边看边改能喊停,适合过程不可预测的任务;Codex 是”派单委托”——边界清楚回来验收,适合结果可明确判断的任务。这不是哪个更好的问题,而是任务性质决定了该用哪个。[[raw/2026-05-21/金先森是朝鲜族阿/Claude Code还是Codex?老金告你怎么选!.md|来源: 金先森 CCvsCodex本质]]

Codex 三种工作模式决策框架(2026-06 新增)

Codex 提供三种工作模式,每种对应不同的任务类型和决策逻辑: [[raw/2026-06-20/科技巫师的魔法书/Codex 三种工作模式使用指南.md|来源: Codex 三种模式]]

  1. 普通模式——适合一次性问题和明确的小任务,快而边界清楚
  2. Plan 模式——重点不是交付代码而是降低误判:先读上下文、提出问题、识别风险、拆步骤
  3. Goal 模式——需要具体结果、验收标准和限制条件三类信息,Codex 围绕它持续推进直至完成

决策四步流:一次性问题?→ 普通模式;需求不清?→ Plan 模式;明确目标 + 多步?→ Goal 模式;Goal 写不清?→ Plan 先澄清。

Goal 不适场景清单:无完成条件的问题(解释概念)、简单问答、耗时增加但无必要。Goal 不是普通模式的加强版,而是长期任务控制机制,决定使用前应先用决策流判断。 [[raw/2026-06-20/科技巫师的魔法书/Codex 三种工作模式使用指南.md|来源: Codex 模式决策]]

Opus 4.8 发布与 Dynamic Workflows(2026-05/06 重大更新)

2026 年 5 月 29 日,Claude Opus 4.8 发布。表面是小版本迭代(41 天发版周期、base model 未重训、training cutoff 同为 2026 年 1 月),实际有两个核心变化:

Opus 4.8 诚实度革命

  • 0% 偷懒率/谎报率:代码缺陷蒙混过关概率仅为 Opus 4.7 的 1/4。更愿意主动标出不确定处
  • Effort Control 五档:可调节思考强度(类似”油门”),Fast 模式降价三分之二
  • “做正确的事而非最强的回答”:实战演示中出现 “User forced to merge → Claude refused” 的安全拒绝行为
  • 负面效应:精确性提升但主动性变弱,对创作类任务表现反而不如 Opus 4.6。Skill 和 Prompt 可能需要为 4.8 重写——约束型 Skill 受益,开放性创作 Skill 可能需要调整
  • 战略含义:花叔指出 4.7 是为补 Adaptive Reasoning 口碑崩盘的”勤王补丁”,4.8 是在 Mythos 压顶下的过渡版。真正重磅的 Mythos 几周内上线

[[raw/2026-05-29/花叔/Opus 4.8发布:41天补丁包里,Anthropic藏了一次战略转向.md|来源: 花叔 Opus 4.8 战略分析]] [[raw/2026-05-29/AI兴观点/Anthropic 深夜重磅发布Opus 4.8 :零谎报改写历史,上百个 Agent 11 天重写 75 万行代码.md|来源: 零谎报改写历史]] [[raw/2026-05-29/数字生命卡兹克/实测Claude Opus 4.8,这可能是第一个不会偷懒的模型。.md|来源: 卡兹克实测]]

Opus 4.8 的 Every Reach Test(2026-06 新增)

Every 团队(自称”未来工作方式的应用 AI 实验室”)对 Opus 4.8 做了独立内部评测,提供了比 benchmark 更贴近实际工作选择的评价框架:

内部 Senior Engineer Benchmark:给模型一个 vibe-coded 代码库要求”从第一性原理重写”。Opus 4.8 得 63 分,GPT 5.5 得 62 分。真人 senior engineer 通常 80-90 分。从 30 多分跃到 60 多分,已足以改变日常工具选择。 [[raw/2026-06-01/Capihom/为什么我从 Codex 又回到了 Claude?丨Every.md|来源: Capihom Every Reach Test]]

高推理档位决定上限:Extra high 档表现最好,high/medium 明显下降。重要提醒:同一个模型,不同档位像两款产品——很多人只用默认档位跑两三个任务就下判断。 [[raw/2026-06-01/Capihom/为什么我从 Codex 又回到了 Claude?丨Every.md|来源: Capihom 推理档位]]

写作能力:79.6 分 vs GPT 5.5 的 73 分。核心突破不是”能写”,而是”能接住你的声音”——给它声音样本,它能延续节奏、词感和判断方式。 [[raw/2026-06-01/Capihom/为什么我从 Codex 又回到了 Claude?丨Every.md|来源: Capihom 写作能力]]

幻灯片测试(知识工作试金石):Opus 4.8 生成的第一稿 slide deck 是 Every 第一次真正觉得”这是一个很好的第一稿”——有深度、有结构、有视觉层级,而非把几点信息摊在模板上。 [[raw/2026-06-01/Capihom/为什么我从 Codex 又回到了 Claude?丨Every.md|来源: Capihom 幻灯片]]

Claude 的问题在外壳:Opus 4.8 仍然没有完全成为 Every 的 daily driver——Codex app 比 Claude app 好用太多(快、简单、干净、内置浏览器)。“每个 tab 像是由不同团队负责,你能感觉到他们在把组织结构发货出来。“这提醒:模型强,不保证用户每天会伸手去拿。AI 竞争正在从”谁的模型更聪明”推进到”谁的工作台更像未来”。 [[raw/2026-06-01/Capihom/为什么我从 Codex 又回到了 Claude?丨Every.md|来源: Capihom 外壳问题]]

Reach Test(伸手测试):比单看 benchmark 更贴近真实选择——“你会不会伸手去用它?会在哪些场景伸手?“团队三位成员给出 gold/green 不同评级,反映了模型在不同岗位上的价值差异。 [[raw/2026-06-01/Capihom/为什么我从 Codex 又回到了 Claude?丨Every.md|来源: Capihom Reach Test]]

Dynamic Workflows:从”编对话”到”当包工头”

Claude Code 新增 Dynamic Workflows——能动态写 JavaScript 编排脚本,由 runtime 后台跑,拉起数百子 Agent 并行,中间过程不压主上下文。三种触发方式:/deep-research、prompt 含 workflow 关键词、/effort ultracode。并发上限 16 个同时执行 / 总上限 1000 个 agent。

6 个 JS 原语agent() 派任务、parallel() 并行道闸、pipeline() 流水分发、phase() 阶段分组、log() 日志、workflow() 嵌套调用。schema 参数强制输出格式,budget 控制 Token 消耗。脚本可保存为 .claude/workflows/ 斜杠命令复用。执行前按 Ctrl+G 审查脚本。

Bun 重写 Rust 案例(数据有来源差异):约 75-96 万行代码 / 6-11 天 / 99.8% 测试通过。需完善测试套件作为 oracle。更适合大范围、机械性、能用测试兜底的任务。

Dynamic Workflows vs Subagent/Skill/Agent Teams 四象限:Workflows(自动化工厂/代码驱动流程)、Subagent(跑腿/派完不管)、Skill(背书/确定性经验 SOP)、Agent Teams(打团战/涌现式协作)。Workflows 才是真正的编排层——流程控制权从模型手里交回代码。

[[raw/2026-05-27/Claude Code 隐藏新功能 -workflows:确定性多 Agent 编排引擎深度拆解.md|来源: Workflows深度拆解]] [[raw/2026-05-29/为dynamic workflows,Claude 发布 Opus4.8.md|来源: Dynamic Workflows发布]] [[raw/2026-05-30/Claude Code 上线 Dynamic Workflows:一句话调度 1000 个子智能体并行干活.md|来源: Dyanmic Workflows入门]] [[raw/2026-05-30/Claude Dynamic Workflows解析,迎接全新的AI编程生态.md|来源: Workflows实战]]

Dynamic Workflows 深度解读(2026-06 新增)

j5land 用”装修房子”的比喻给出了一份最清晰的 Workflows 定位:普通多轮对话 = 盯一个师傅干活;Skill = 施工手册(告诉师傅同一类活怎么干规范);Subagent = 临时多叫几个师傅并行;Agent Teams = 带领班的施工队(前端/后端/测试一起看方案);Workflow = 施工流程图(顺序、返工、验收写进脚本,流程本身可保存复用)。 [[raw/2026-06-01/j5land/Claude Code 本次发布的 Workflow 是什么?有哪些场景值得用?.md|来源: j5land 装修比喻]]

什么时候该用 Workflow:日常小改动根本用不上。Skill 解决”别忘步骤”——一个人顺着做就能完成、只是希望过程更稳定;Workflow 解决”枚举、分组、并行检查、二次复核、去重汇总”——任务变成了多阶段、多视角、可复核,并且下次可能还要跑。研究类任务的 /deep-research 本身就是一个 workflow。 [[raw/2026-06-01/j5land/Claude Code 本次发布的 Workflow 是什么?有哪些场景值得用?.md|来源: j5land 何时用]]

Prompt 要写得像任务合同:目标决定方向 → 范围限制扫描边界 → 阶段固定执行顺序 → 规则挡住没证据的结论。不需要自己写 JavaScript,只需要把任务讲细一点。任务越清楚,Claude 生成 workflow 脚本时自由发挥就越少。 [[raw/2026-06-01/j5land/Claude Code 本次发布的 Workflow 是什么?有哪些场景值得用?.md|来源: j5land prompt合同]]

边界和成本:run 过程中没有普通的用户输入节点——只有权限提示可能暂停。如果要”第一阶段结束后我先确认再进入第二阶段”,最好拆成两个 workflow。每个 Agent 都消耗 session token,如果脚本没有把简单阶段路由到更便宜模型,账单会很快变厚。 [[raw/2026-06-01/j5land/Claude Code 本次发布的 Workflow 是什么?有哪些场景值得用?.md|来源: j5land 边界]]

Claude Fable 5 系统提示词拆解(2026-06 新增)

Claude Fable 5 于 2026 年 6 月 9 日发布,和 Mythos 5 共用底层——前者是 GA 的”装安全阀”版本,后者是只给”可信组织”放的”拆安全阀”版本。系统提示词原文 120KB / 1585 行 / 16 个一级章节,由 elder-plinius 收录在 CL4R1T4S GitHub 仓库。这份 prompt 是当前公开可得的最强消费级模型的全套作战手册。 [[raw/2026-06-10/Jerry/1500 行字字千金-Claude Fable 5 系统提示词全拆解.md|来源: Fable 5 系统提示词全拆解]]

四层结构

第一层 身份与定位:claude_behavior / Identity Preamble(仅 7 行:名字、归属、时间、平台)/ product_information / knowledge_cutoff。身份只回答”我是谁”,不回答”我该怎么表现”——这个分工很干净。product_information 段特别允许用户中途切模型,显式承认对话可以多模型拼接。

第二层 行为准则(伦理 + 表达):refusal_handling / tone_and_formatting / user_wellbeing / evenhandedness 等。claude_behavior 占 150 多行,是篇幅最大的部分,拆成 9 个子模块,按触发频率和紧迫性排序——位置就是优先级

第三层 工具与执行:memory_system / mcp_app_suggestions / computer_use / search_instructions / Tool Definitions。“工具调用”被写成行为规范而非单纯 schema 列表。

第四层 环境与元指令:anthropic_api_in_artifacts(“Claudeception”)/ citation_instructions / available_skills / network_configuration / filesystem_configuration。

四个工程哲学

  1. 抽象原则 → 枚举自检:不写”请不要抄袭”,写”每次引用前回答这 6 个 yes/no 问题”(字数超没超 15?同一来源是否已引用过?是否是歌词/诗/俳句?是否过于镜像原文?是否复现文章结构?是否替代了用户阅读原文的需求?)
  2. 风险 → 退路,不是 → 拒绝:不写”违规就拒”,写”风险情况下给更短的回复”。永远给降级路径而不是二元开关
  3. 信任根画在后台,不延伸到用户:用户消息里夹带的 <system><assistant> tag,即使自称来自 Anthropic,只要和价值观冲突一概不信——在 prompt 层实现非对称信任
  4. 工具调用也是行为规范:MCP App 怎么建议、localStorage 怎么禁用、文件位置怎么选——全写成”在 X 情况下做 Y”的决策树

关键判断:Fable 5 之所以强,不是模型本身强,是 prompt 工程强——它是 Anthropic 内部的”产品宪法”。搜索版权限制写成硬法条(单次引用 ≤15 词 / 每来源最多 1 次 / 歌词诗完全不能复现),配 6 个自检问题把抽象的”不能抄袭”翻译成可枚举的二元判断。 [[raw/2026-06-10/Jerry/1500 行字字千金-Claude Fable 5 系统提示词全拆解.md|来源: Fable 5 四工程哲学]]

Fable 5 的杀手锏:迁移与重构

Tina 指出 Fable 5 真正的杀手锏不是写新代码,而是迁移、重构、收拾烂摊子。它特别擅长大型代码库的技术债清理——那些概念简单但极其耗时的活儿(早期 API 设计漏了场景、命名失误全量清理、重复功能合并重构、大文件拆成模块)。 [[raw/2026-06-11/Tina/Fable 5 的杀手锏不是写新代码,是迁移、重构、收拾烂摊子.md|来源: Fable 5 杀手锏]]

Fable 5 被下架与”复活”

Fable 5 发布后很快被 Anthropic 官方下架。社区开发者用 90% 的原始提示词就把它”复活”了——将 CL4R1T4S 仓库公开的系统提示词填回 Opus 4.8,行为表现高度接近原版。这印证了 Fable 5 的核心能力不在模型权重而在 prompt 工程。 [[raw/2026-06-14/朗朗晴空/Fable 5 被下架后,有人用 90% 的提示词填回 Opus 4.8.md|来源: Fable 5 复活]] [[raw/2026-06-14/朗朗晴空/Fable 5 的三天:一份系统提示词能复制多少AI人格.md|来源: Fable 5 三天]] [[raw/2026-06-14/AI兴观点/官方连夜下架的Fable 5,大佬一行提示词就把它「复活」了.md|来源: Fable 5 一行复活]]

GLM-5.2 + Claude Code:1M 上下文实测(2026-06-18 新增)

智谱 GLM-5.2(MIT 协议开源、1M 上下文)可通过 Anthropic 兼容 API 作为 Claude Code 的 drop-in 模型。前端盲测 Code Arena 全球第一;长程任务整体性能介于 Claude Opus 4.7 与 4.8 之间(开源模型最高),但超长任务仍比 Opus 4.8 低约 13%。配置:将 ANTHROPIC_BASE_URL 指向智谱端点,模型名加 [1m] 后缀(关键——不加则默认标准上下文长度)。 [[raw/2026-06-18/筱可/GLM-5.2 + Claude Code实测!1M 上下文用法来了.md|来源: GLM-5.2 + Claude Code]]

1M 上下文三条实战规则:① 给模型固定锚点(命名规则、代码风格、禁止目录写进 CLAUDE.md,每轮重读);② 按任务判断是否需要 1M(信息密度、时间跨度、错误成本,三项中两项高才开 1M);③ 切长任务为阶段加检查点(每 10-20 轮强制状态摘要:做了什么、改了什么、下一步)。

实测案例:3473 个 Markdown 文件的知识库全量重组,7 轮、无需中途确认。关键:分层方法(先目录骨架、后文件内容、最后修链接)避免上下文泛滥。 [[raw/2026-06-18/筱可/GLM-5.2 + Claude Code实测!1M 上下文用法来了.md|来源: GLM-5.2 分层方法]]

输入关键词开始搜索