Clipping 微信公众号

Codex负责人:Codex不只是写代码,Agent正在进入日常工作丨OpenAI

by Capihom 原文 ↗
Created: 2026-05-21

公众号名称:晚点再听LaterCast

作者名称:Capihom

发布时间:2026-05-21 20:41

我们每天为你更新硅谷最新的 AI 创业与科技播客总结,让你与前沿保持同频。全文约 3900 字,如果你现在没有时间,试试转成播客稍后再听晚点再听LaterCast

“软件工程师一天里大部分时间并不在写代码。”

“复制粘贴的时代结束了。”

“现在 Codex 里执行的大多数任务,其实已经不是写代码。”

这期对话请来 OpenAI Codex 负责人 Thibault,讨论一个很直接的问题:为什么一个名字里带 code 的工具,会开始进入研究、运营、财务、产品、设计和个人生活。Thibault 的答案并不靠愿景包装,而是来自 OpenAI 内部已经发生的工作变化。Codex 先服务开发者,随后被团队拿去追踪发布计划、整理 Slack 与 Notion、生成研究材料、做数据分析,最后变成很多人电脑里的执行入口。**这期最值得读的地方,是它把“AI Agent 改变知识工作”讲成了具体动作。**这期内容也很适合工程、产品、运营团队一起看:工程师能看到自己每天被多少非编码事项拖住,PM 能看到计划同步和跨团队追踪怎么被拆解,管理者能看到组织瓶颈如何从工程移动到沟通、市场和安全治理。它没有把 Codex 讲成万能助手,而是把一次次可验证的工作交付摆在桌面上。

Codex 先从云端 PR 开始

Thibault 回忆,Codex 最早公开形态是 Codex web:用户在网页里写下任务,Agent 到代码仓库里找上下文,判断要改哪些文件,然后在 GitHub 上开一个 pull request。这个版本听起来完整,实际摩擦很高。开发者自己的电脑上已经有调好的环境、脚本和习惯,OpenAI 在云端复制一套设置很难。模型当时处理长任务也还不够可靠,迭代成本被环境配置放大。团队后来意识到,Agent 要帮人工作,必须贴近人原本工作的地方。

“你只要说明意图,最后就会收到一份代码修改。”

早期 Codex web 的失败点很典型:任务描述已经足够自然,最后交付也足够清晰,中间的工作环境却离用户太远。开发者不愿意为了一个 Agent 重新配置依赖、权限、测试命令和本地脚本。Thibault 说模型也需要更快反馈,云端隔离环境让每次失败都显得笨重。后来的方向变成把 Codex 拉回用户电脑,让它靠近已有文件、命令和工作习惯。

工程师每天只写两三成代码

这次转向的起点,是团队重新看软件工程师的一天。写代码只占 20% 到 30%,剩下时间在看 ticket、排优先级、讨论架构、查 bug、判断用户反馈是否成立、处理 on-call、理解系统和收集信息。为了让 Codex 更会写代码,团队接入更多上下文:代码之外的 Notion、文档、讨论记录。接入之后,Agent 能处理的任务边界自然外扩。当工具能读懂工作上下文,它服务的对象就不再只是代码文件。

“软件工程师大概只有 20% 到 30% 的时间真的在写代码。”

这个比例解释了 Codex 为什么会自然越过代码边界。工程师写一段功能前,要先读需求、查历史讨论、确认接口、复现 bug、理解监控报警;写完后还要解释改动、推动 review、同步上线计划。Agent 如果只会改文件,只覆盖了工作链条里很短的一截。能读文档、能搜上下文、能整理信息后,它开始进入更大的知识工作流程。

发布前的计划开始自动更新

让 Thibault 确信“它会给所有人用”的场景,发生在一次 Codex 发布前。产品负责人 Alexander 用 Codex 追踪所有将要合入的改动:用户反馈在哪里,哪些功能还要打磨,开发同事的状态如何,计划文档要怎么更新。过去,这类协调要人在 Slack、文档和 GitHub PR 之间来回翻。那次会议里,Alexander 一边和 Thibault 讨论,一边让多个 Codex Agent 追人、汇总、更新计划。协调工作没有消失,只是开始被拆成一组可委托的小任务。

“它像有很多个小 Codex Agent,在替他追人、更新文档。”

发布前最难的环节,常常是让方案每天保持新鲜。有人刚回复了一个 bug,有人改了排期,有个用户反馈改变了优先级,文档很快过期。Alexander 的做法像给计划文档接上了后台工人:Agent 去各处捞信息,发现缺口就发消息追问,再把状态写回同一份计划。PM 的手从搬运信息里抽出来,才有时间判断取舍。

OpenAI 的瓶颈转向叙事

Codex 对工程速度的影响很快外溢。Thibault 说,工程师被大幅加速之后,设计师和 PM 的角色也跟着变化:设计师开始直接推代码,PM 更快把反馈和计划整理成可执行任务。新的堵点出现在沟通和市场部门,因为公司突然能产出更多东西,外部叙事要跟上节奏。财务团队也在用 Codex,Sarah Friar 曾用它协助组织最新一轮融资材料。速度提升后,组织要重新分配注意力,而不是只给工程团队加人。

“到现在,Codex 对我们已经是关键工具。”

组织里的瓶颈移动,是这类工具最容易被低估的后果。工程更快以后,设计要跟上体验细节,产品要更快吸收反馈,市场要把更密集的发布讲清楚,财务和运营也要处理更多材料。OpenAI 的案例提醒管理者:部署 Agent 不是只看个人提效,还要观察下游部门有没有被突然增加的产出压住。

面包地图让个人软件成真

为了说明非程序员能怎么用 Codex,Thibault 现场讲了一个很小的个人项目。他觉得旧金山面包太贵,就让 Codex 找出城里值得买的面包,做成 spreadsheet,列出 Jane the Bakery、Arsicault、Tartine 等店、品类描述和价格。接着他又让 Codex 把表格变成网页地图,标出地点和选择。整个过程大约十分钟,还可以直接用语音发起。过去“写代码”是门槛,现在代码更像 Agent 使用的一种工具。

“每个人都能拥有自己的个人软件,并维护它,让它刚好做自己需要的事。”

面包地图听起来很轻,却点中了软件生产的变化。很多人并不想发布一个产品,只想给自己做一个临时工具:把城市里的面包按价格和质量排一下,把咖啡店换成同样逻辑,把结果做成能点开的网页。过去这类需求会停在脑子里,因为不值得花周末写代码。现在,一个语音指令就能把数据、表格和页面连起来。

一天上百个小任务交给 Agent

Thibault 自己已经把 Codex 当成小型 chief of staff:整理桌面文件,管理 compute fleet,查看 on-call 轮值和工程师状态,检查发布排期里哪些事项有延误,甚至每天 9 点自动从 Gmail、Notion、calendar 里整理当天摘要。很多任务以前会因为“不值得麻烦别人”而被搁置,现在直接丢给 Codex。它释放的是那些长期压在脑子里的小动作:每天都在想、每周都拖、最后从来没人认真处理的琐事。

“我每天会丢给 Codex 可能超过一百个小任务。”

Thibault 对“工作更快乐”的描述也很具体。他看到 Twitter 上一个低优先级 bug,以前可能判断只影响三个用户,排不上队;现在直接丢给 Codex 调查。他每天早上收到按个人偏好整理的新闻简报,也让 Agent 盯发布日程里的延误。减负的核心不只是省几分钟,更多是少掉一批总在后台占用注意力的未完成事项。

企业先要管住权限边界

被问到企业采用的最大阻力,Thibault 没把答案归给模型能力。他认为能力已经足够让人使用,阻力主要在信任:Agent 能不能安全处理文件、邮件和内部信息。OpenAI 的做法是让 Agent 默认在 sandbox 里运行,只能访问文件系统中特定部分,也可以关闭网络访问。企业还能设置更多控制。团队还做了 auto review,让另一个 Agent 审查主 Agent 的动作,发现高风险行为时拦下来。Agent 进组织,第一步要先把可读、可写、可联网的边界讲清楚,再谈能交给它多少事。

“默认情况下,Agent 会在沙盒里运行,并带着严格控制。”

主持人把 sandbox 解释给非工程观众听:它可以像一个文件夹,也可以像公司里的权限隔离。某些数据只允许读取,不允许写回、删除或外传。Thibault 还提到 auto review:主 Agent 想完成任务,审查 Agent 负责盯着动作是否危险。企业真正要买的,是一套能承受真实权限和合规压力的工作方式。

好老板会把验收标准讲清楚

非开发者要把 Codex 用好,Thibault 给了三个习惯。第一,保持创造性,多看别人怎么用。第二,指令要具体,像带一个刚入职、不了解你偏好的新人:告诉它去哪找资料、哪些文档相关、完成品要长什么样。第三,连接更多信息源,日历、文档、Notion、常用工具都能成为上下文。他还提醒,别把理解也全部外包。过度委托会让人失去对问题的把握,Codex 也应该用来解释、画图、帮助学习。会用 Agent 的人,往往先会定义成果。

“如果你能描述好什么叫完成,Codex 就更容易判断自己做得怎样。”

他举了一个做幻灯片的例子:不要只说“帮我做个 deck”,而要说明一共 10 页,前两页放背景,中间六页做技术拆解,最后两页留开放讨论和 Q&A。这样的描述给了 Agent 自检依据。非技术用户最该练的能力,反而像管理新人:交代资料、交代偏好、交代验收方式。上下文越好,输出越少靠运气。

主持人在结尾给了一个很低门槛的练习:想一个生活或组织里的 workflow,比如研究简报、计划、入职流程、报告、决策备忘录,然后交给 Codex 试一次。这个动作比听一百次演示更重要,因为每个人的卡点都藏在自己的文件、日历、消息和偏好里。只有把真实材料交进去,才会知道 Agent 能替你搬走哪一块重复劳动。放到团队场景里,面包地图对应的是一类过去很少被立项的小工具:销售想临时整理客户名单,运营想把一批反馈按主题聚类,市场想把公开评论做成情绪看板,创始人想把某个城市的供应商价格拉成表格。需求很具体,生命周期很短,以前排不到工程资源。Agent 让这类一次性工具有了新的经济账,做完就用,用完就改,没人需要为它开正式项目。Thibault 还反复提到一个细节:他越来越少亲自点击、复制、粘贴和找入口。文件在电脑里,图片在本地,消息在协作工具里,Codex 可以直接读取、移动、整理和执行。工作入口从一个个应用按钮,慢慢变成一句带目标的指令。这一点会改变团队对软件的想象:很多内部工具不再等待排期,而是在当天被做出来、被试用、被丢弃或继续迭代,并立刻拿真实使用反馈验证。

写在最后

这期对话给人的启发很朴素:先别急着问 Codex 能不能替代谁,先找一个每天反复消耗你的流程。研究简报、发布计划、报表、客户反馈、个人文件整理,都可以拿来试。把资料给足,把验收讲清楚,让它做一次具体工作,答案会比任何趋势判断都更诚实。

内容来源:“Codex for Everyday Work: AI Agents Beyond Coding”丨OpenAI Forum

原视频:https://www.youtube.com/watch?v=DLP9CagE3dU

如果你喜欢深度好文,试试用小程序将不方便立刻阅读的文章转成播客,用「听」的方式,稍后阅读,不再错过好文章⇣

⇣ 关注我,每天为你更新硅谷最新的 AI 创业/科技播客总结,让你与前沿保持同频 ⇣


Original Capihom 晚点再听LaterCast


内容效果不满意?点此反馈

输入关键词开始搜索