为什么我从 Codex 又回到了 Claude?丨Every
公众号名称:晚点再听LaterCast
作者名称:Capihom
发布时间:2026-06-01 21:16
我们每天为你更新硅谷最新的 AI 创业与科技播客总结,让你与前沿保持同频。全文约 3900 字,如果你现在没有时间,试试转成播客稍后再听「NEW!新音色已上线」晚点再听LaterCast
“Anthropic 回来了。”
“这个模型像是一个范式转移,被包在一个还不错的外壳里。”
“我们正在进入一个世界,外壳和模型一样重要。”
Every 把自己定义成“未来工作方式的应用 AI 实验室”,团队约 30 人,长期用 AI 做写作、编码、设计、社区运营和内部产品。主讲人开场很直白:Opus 4.7 虽然 benchmark 有提升,但速度慢、不好用、很难爱上;过去一两个月,他和团队里不少 Claude 重度用户都转向 Codex 和 GPT 5.5。Opus 4.8 让这个判断发生逆转。这期视频最值得关注的,不只是“Claude 又强了”,而是模型能力、推理档位和产品外壳正在一起决定知识工作者每天伸手拿哪个工具。
Opus 4.8 让 Claude 重新回到桌面
Every 团队内部提前测试了大约一周。主讲人说,Anthropic 可能想低调一点,把它叫 Opus 4.8;从他的使用感受看,叫 Opus 5 也能说得过去。过去一段时间,Claude 的气氛并不好。Codex 桌面端又快又干净,GPT 5.5 开始进入他们的写作和编码工作,连团队里的 Claude 老用户也开始松动。Opus 4.8 的意义在于,它把很多人从“默认打开 Codex”拉回到“至少要同时开着 Claude”。
“我已经几乎只用 Codex 和 GPT 5.5 做所有事情,过去一两个月基本都是这样。”
他给出的总评很少见:Opus 4.8 是一个“legitimately great model”。在 Every 的内部 senior engineer benchmark 上,Opus 4.8 得到 63 分,比 Opus 4.7 高约 30 分,也比 GPT 5.5 高 1 分。这个差距不代表它已经接近人类资深工程师,Every 的两个真人 senior engineer 通常能拿到 80 到 90 分;但对一个模型来说,从 30 多分跃到 60 多分,已经足以改变日常工作里的工具选择。
高推理档位决定上限
Every 对 Opus 4.8 的第一个提醒是:它对 reasoning 设置非常敏感。主讲人明确建议,遇到最难的编程挑战、重要写作和复杂知识工作时,要用 high 或 extra high reasoning。模型在 extra high 上表现很好,在 high 和 medium 上会明显下降。对经常测模型的人来说,这是一条实际工作里的提醒:同一个模型,不同档位可能像两款产品。
“如果你在测试最难的编程挑战和非常重要的写作,我强烈建议用 high 和 extra high 设置。”
这个细节对团队采购和个人工作流都有影响。很多人试一个新模型,只用默认档位跑两三个任务,然后下判断。Opus 4.8 的表现提醒我们,模型评估开始像调相机参数或 IDE 配置:默认值只给出一个印象,真正用于核心任务时,需要知道何时提高推理预算,何时接受速度换质量,何时把低档位留给普通整理工作。
工程 benchmark 看重重写烂代码
Every 的 senior engineer benchmark 很有意思。测试没有停在算法题,而是给模型一个 vibe-coded 代码库,然后要求它“从第一性原理重写”。Every 还让两位真人 senior engineer 做同样的重写,以便对照模型输出。这比单纯看代码能不能跑更接近真实团队场景:AI 写出来的东西越来越多,接下来更贵的活会变成清理、重构、解释架构和把工程质量拉回可维护状态。
“我们给模型一个 vibe-coded codebase,然后说:这是一坨 vibe-coded slop,请你从第一性原理重写它。”
Opus 4.8 在这个任务上拿到 63,GPT 5.5 拿到 62。Every 还用了 Kieran 的 LFG bench,测试建 SaaS、电商网站和 3D 游戏场景等真实风格任务。Kieran 的反馈是,Opus 4.8 写出的代码可读性强,能在“好程序员”和“有创造力”之间架桥。一个 cozy island 3D 场景任务里,GPT 5.5 做得更直接,元素也多;Opus 4.8 的画面更 lush、更有层次和性格。
主讲人把差异描述得很细:GPT 5.5 像是在快速把任务打掉,Opus 4.8 则更愿意生成有质感的结构和细节。放在工程团队里,这会影响任务分配。需要可靠完成、快速扫清 backlog 时,Codex 和 GPT 5.5 的产品外壳仍然有优势;需要重构、探索方案、做更有审美和可读性的第一版时,Opus 4.8 重新变得有吸引力。
写作能力开始接近“接住你的声音”
Every 的写作 benchmark 也给了 Opus 4.8 很高评价。它们测试了文章开头、促销邮件、正文中段落等任务。Opus 4.8 得到 79.6 分,GPT 5.5 是 73 分。主讲人说,它很快、表达力好,尤其在 high reasoning 下 AI 痕迹更少;medium 档会变差,所以写重要内容时要谨慎选择档位。
“如果你给它一段自己的声音,然后说继续写,它会以一种非常像你的方式继续下去。”
这里的重点不在“AI 会写文章”这个老话题,而在它能否抓住上下文里的 voice。很多模型能写顺滑句子,却把所有人写成同一种 LinkedIn 体。Opus 4.8 让 Every 看到另一种可能:给它足够的样本,它能延续某个人的节奏、词感和判断方式。对内容团队、市场团队和创始人写作来说,这会把 AI 从“代写工具”推向“能接住半成品的编辑搭子”。
知识工作里,幻灯片是试金石
Every 一直会测模型做知识工作的能力,其中一个任务是做 presentation。Opus 4.8 生成了一份介绍 Every 工程哲学“component engineering”的入门 slide deck。主讲人说,很多自动生成的 deck 会显得 thin,像把几点信息摊在模板上;这次的 deck 有深度,样式也不错,是他第一次真正觉得“这是一个很好的第一稿”。
“它做了一份初学者 slide deck,而且真的很好。很多自动生成的 deck 会很薄,这份有深度。”
幻灯片任务看起来普通,实际很能测模型的综合能力。它需要理解主题、规划结构、控制信息密度、做视觉层级,还要知道哪些内容放标题,哪些放说明。一个能做出“好第一稿”的模型,会直接影响 PM 写方案、创始人准备融资材料、咨询顾问搭客户 deck、运营团队做培训课件的速度。Every 把 Opus 4.8 称作有“daily driver smell”,原因也在这里:它能在编码、写作和 deck 之间来回切换。
主讲人强调,这是他第一次在自动生成 deck 上看到足够好的“第一稿”。第一稿这三个字很重要:它不需要替人完成最后交付,却能把空白页面变成可讨论对象。团队开会时,大家可以围绕一份已经有结构、有标题、有例子的材料删改,而不必先花一小时搭骨架。
Claude 的问题在外壳
Every 的评价并非一路夸到底。主讲人说,Opus 4.8 仍然没有完全成为他的 daily driver,原因很具体:Codex app 比 Claude app 好用太多。Codex 快、简单、干净,内置浏览器也能很好地帮助知识工作。Claude 桌面端则有 chat、code、co-work 等多个 tab,像是把 Anthropic 走到今天的组织历史留在了产品表面。
“每个 tab 像是由不同团队负责,你能感觉到他们在把组织结构发货出来。”
这段评价对所有 AI 产品团队都很刺耳。模型强,不保证用户每天会伸手去拿。用户每天打开哪一个工具,常常取决于入口是否清楚、等待是否短、上下文是否自然、浏览器和文件是否顺手。主讲人已经开始在 Claude app 和 Codex app 之间来回切换,但 Codex 仍占据他全天工作的中心。AI 竞争正在从“谁的模型更聪明”推进到“谁的工作台更像未来”。
他特别提到 Codex app 的内置浏览器。知识工作经常需要边查资料、边写、边验证、边改,单轮问答很难覆盖完整流程。一个浏览器在同一个工作台里跑顺,会直接改变体验。Claude app 里的 chat、code、co-work 各自像一个入口,用户要先判断去哪一格;Codex 更像把动作收进一条主线。PM 和设计师可以从这里读到一个产品判断:AI 的下一轮体验竞争,很可能发生在“少让用户想一步”。
Reach test 比榜单更接近真实选择
Every 有一个很朴素的 reach test:你会不会伸手去用它?会在哪些场景伸手?这次有三个人给分。主讲人给 Opus 4.8 的评价是 gold,也带一点 green,因为外壳还不够好;Kieran 给了罕见的 gold,认为它是 paradigm shift;Katie 给了 green,主要用于写作和知识工作,也在它和 Codex 之间来回比较。
“如果你做的是我们这类工作,它像是一个范式转移模型,被包在一个还不错到挺好的外壳里。”
这个测试比单看 benchmark 更贴近工作。一个模型分数很高,但用户想不起要在哪个场景打开它,价值就会被产品外壳吃掉。Opus 4.8 让 Every 团队重新把 Claude 放回工具栏,尤其是 Claude 老用户会非常喜欢;被 Codex 转化的人,也至少应该把它加入 arsenal。团队管理者评估模型时可以借鉴这种方法:别只问哪个模型第一,问团队在写代码、写文章、做 deck、做决策时,会自然伸手拿哪个。
Reach test 还会暴露角色差异。主讲人做很多 CEO 工作,横跨编码、写作和决策,所以他给出 gold 加 green;Kieran 一天到晚跑 50 个 agent,历史上也是 Claude 重度用户,因此给到最强的 gold;Katie 主要用它写作和做知识工作,感受更稳健。一个模型在不同岗位上的价值,不会被同一张总榜完全表达出来。
管理和个人判断也进入测试范围
视频后半段还有一个小细节。主讲人说,他把 Opus 4.8 用在一些内部心理和人际场景里,比如管理、朋友关系、复杂沟通。他觉得这个模型情绪智能很高,尤其擅长推动他的框架。它不算强硬反对,但从 thinking trace 里能看到它认真走过不同排列组合,帮助他扩大对某个局面的看法。
“它非常擅长推动我的框架。我不会说它很爱反驳,但它非常周到。”
这部分和工程 benchmark 放在一起看,能看出 Opus 4.8 的定位:它不只是写代码,也能做跨职能知识工作。CEO 工作、管理判断、写作、编码、deck、个人沟通,很多场景并不需要模型给唯一答案,更需要它先展开局面、提出几个可能路径、帮助人看见自己忽略的角度。Every 对 Opus 4.8 的兴奋,也来自这种跨场景的稳定性。
这种能力也解释了为什么主讲人把它推荐给已经转向 Codex 的人。Codex 像一个快速、简洁、能把任务推进到底的工作台;Opus 4.8 在一些需要表达、判断、审美和人际语境的任务里,把 Claude 的老优势重新拉了回来。未来几个月,很多人的实际工作流可能不会只剩一个入口,而会在两个或三个强工具之间切换:一个负责跑任务,一个负责写和想,一个负责把资料组织成可交付的材料。
他最后给 Claude 用户的建议也很实用:去 Claude 桌面端和 Claude Code 里亲自试,尤其把高推理档位打开。Every 后续还会继续滚动更新测试结果,但 day-zero 的结论已经足够清楚:Anthropic 至少重新赢回了试用资格。曾经把 Claude 从工具栏拿掉的人,现在有理由再把它放回去。
写在最后
Opus 4.8 给人的启发很直接:别只追榜单第一名,也别只看自己习惯的 app。重要任务用高推理档位试一次,拿真实代码、真实文章、真实 deck 去测。模型会继续轮流领先,能把强模型接进日常工作台的人,会更早拿到红利。下一次工具切换,可能不来自某张总榜,而来自你在一个真实项目里突然发现:它接住了原来接不住的那一段。把工具放进项目里测试,答案会比争论更快出现,也会让团队少走很多弯路。先用起来,再决定留下谁,删掉谁,别凭印象投票,尤其别凭旧印象做判断。
内容来源:“Why Opus 4.8 Pulled Me Back to Claude”丨Every
原视频:https://www.youtube.com/watch?v=kXYDUozZAhk
如果你喜欢深度好文,试试用小程序将不方便立刻阅读的文章转成播客,用「听」的方式,稍后阅读,不再错过好文章⇣
⇣ 关注我,每天为你更新硅谷最新的 AI 创业/科技播客总结,让你与前沿保持同频 ⇣
内容效果不满意?点此反馈