Codex 杀进 Chrome:操作你的浏览器,登录态可用
公众号名称:程叙架构与AI.
作者名称:AI兴观点
发布时间:2026-05-08 14:10
原文链接:https://developers.openai.com/codex/app/chrome-extension
✅点击上方🔺公众号🔺关注我✅
Codex 现在可以直接操作你的 Chrome 了——而且用的是你已登录好的账号。
不是模拟点击,不是脚本录制。它会在后台跨标签页并行干活,不抢你的浏览器前台。填表单、查后台、录 CRM、搜资料、更新数据——这些在浏览器里重复的劳动,现在直接口头描述给 Codex 就行。
但真正有意思的地方,是它跟之前那些「AI 浏览器」的做法完全不一样。
跟 Operator 们最大的区别:它用的是你的浏览器
Anthropic 的 Computer Use、OpenAI 自家的 Operator、Comet、Dia、Atlas——都在做同一件事:让 AI 替你操作网页。
但之前的做法都有一个共同问题:AI 开的是一个全新、干净的浏览器实例。
你的公司内网、CRM、Notion、Gmail 里登录的状态,AI 一概拿不到。它要替你干活,就得现场重新输密码、过验证码、走 SSO。
Chrome 插件这条路绕开了这个问题。你的 Chrome 里已经登录了 Gmail、Notion、Linear、内部后台,Codex 直接借用这些已登录的会话,等于给 AI 开了一个授权代办的入口。
OpenAI 官方给的一个示例任务很能说明问题:
查一下我最近 Portland 旅行有哪些餐饮报销,把它们加到我的 Navan 报销单里。相关收据可以在 ~/Desktop/receipts 里找。
这个任务横跨了 Gmail(找邮件里的收据信息)、Navan(公司报销系统,需要登录)、本地文件系统(读桌面上的收据)。一个全新打开的浏览器是干不了这件事的。
后台并行,不打扰你
如果你试过让某些 AI Agent 在你浏览器里接管鼠标键盘,就知道那感觉——任务没跑完之前,这台电脑基本就废了,连切个微信都不敢动。
Codex 这次的做法不一样。它会把每个任务放进独立的任务标签组里,你在主窗口干你的活,它在后面新开标签页自己跑。两边互不干扰,进度条在侧边栏能看到。
OpenAI 还展示过一个例子:让 Codex 同时打开 4 个 ChatGPT 标签,分别画 4 个不同风格的灯塔素描,并行跑。每个任务一个标签页,互不影响。

这套工作模式更接近「把任务派出去」而非「AI 借走我电脑」。
底层怎么跑的
早期那些浏览器 Agent 纯靠截图 + 点坐标,Codex 在 Chrome 里干活的方式是写代码并运行代码——写脚本、调 DOM、发请求。视觉那一层只在必要的时候才用。
纯视觉方案听着通用,但实际跑起来慢、成本高、还不稳,碰到结构化页面经常误判。在开发者熟悉的网页结构(表单、表格、API 调用)上,代码路线效率要高得多。
而且任务需要多个工具时,Codex 会自己挑最合适的那个:简单调 API 用插件,需要登录的走 Chrome,该组合就组合,该切换就切换。
一个实测:4 分钟扫完一周社区反馈
OpenAI 放了一个实测过程,看看这玩意儿实际能跑多快。任务是:去 OpenAI 开发者社区论坛扫一遍最近一周关于 Codex 的帖子,提炼用户反馈和核心问题,整理成表格。
整个过程在侧边栏滚动展示,4 分 8 秒跑完:
- 先尝试调用论坛搜索接口,被 Chrome 客户端拦截
- 切换到渲染版搜索页继续
- 直接抓 DOM 链接超时,缩小范围重连
- 拿到 4 月 28 日到 5 月 5 日的 68 条结果
- 挑出高信号的帖子展开看,做交叉验证
- 输出表格
如果你之前手工干过类似的活——比如调研对手社区反馈、定期扫 GitHub Issue——应该能理解这个速度意味着什么。

三层权限控制
默认情况下,Codex 访问每个新网站都会先弹一个确认框。你可以选:
- 允许本次 —— 只当前对话能用
- 永久允许 —— 以后不再问
- 拒绝 —— 这个网站不让进
在 Computer Use 设置里可以统一管理白名单和黑名单。白名单里的域名直接过,黑名单的想都别想。
有一个高风险开关叫「总是允许浏览器内容」,开了以后 Codex 不再需要任何确认。默认是关的,不建议开。
浏览器历史也一样——Codex 想用的时候会先问你,而且没有「总是允许」选项,每次都要问。
怎么装
- 打开 Codex 设置 → Plugins,添加 Chrome 插件
- 跟着引导装扩展、同意权限弹窗
- 打开 Chrome,确认扩展显示 Connected
装好关掉当前线程,新开对话就能用。


权限和数据安全
安装时 Chrome 会列一串扩展权限,包括「读取和修改所有网站数据」。听起来吓人,但这是 Chrome 扩展层面的声明,实际使用时 Codex 有自己的双层权限控制(会话级确认 + 白名单/黑名单),不是装了扩展就全开。
关于数据存储,官方说得很清楚:不存浏览器操作的完整记录。 只有进入对话上下文的内容才会保留——比如 Codex 读到的页面文字、截图、工具调用。操作过程本身不会单独存一份日志。
如果 Chrome 任务需要上传你电脑里的文件,在扩展管理页打开「允许访问文件 URL」就行。

连不上怎么办
按这个顺序查:扩展显示 Connected 吗?插件开启了吗?Chrome profile 用对了吗?换个新线程试试?重启 Chrome 和 Codex 试试?都不行就去 Codex 跑 /feedback。
跟内置浏览器有什么区别
| 对比项 | 之前的内部浏览器 | 现在的 Chrome 扩展 |
|---|---|---|
| 登录态 | 要重新输入密码 | 直接用你已登录的账号 |
| 多标签 | 只能操作单个页面 | 跨标签页并行 |
| 前台占用 | 要切换过去看进度 | 后台运行,不影响你 |
| 敏感操作 | 直接执行 | 提交/下载前先确认 |
从「Codex 自己有个浏览器」变成了「Codex 用你的浏览器」。
目前的主要短板
客观说几个限制。只支持 Chrome。 Edge、Brave、Arc 这些 Chromium 内核浏览器都不行。OpenAI 明确写了 “only with Chrome”。
权限要得猛。 安装包 109 KB,意味着重逻辑都在云端。插件权限范围基本等于你浏览器里的一切。对个人用户来说双层权限控制够用,但对有合规要求的企业,光权限这一条就够 IT 部门开几次会。
使用门槛。 部分地区无法直接装,需要曲线下载。账号本身也对一些市场有限制。
放在大图景里
把这次更新放回 OpenAI 这两年做的事情里看:
- 早期推 Operator,验证「浏览器代理」这个形态
- 随后把「看真实业务数据」的能力补进生态
- ChatGPT 的 Atlas 模式让 AI 能跨工具调度
- 现在的 Chrome 插件,把这一切搬进你已经登录、已经在用的浏览器
OpenAI 不打算再造一个浏览器。它的策略是:Chrome 你接着用,AI 我塞进去。
一个 AI agent 从「能写代码」到「能操作你的浏览器」——写代码对应的是开发工具链,操作浏览器对应的是整个互联网。中间的跨度,比看起来大。
觉得有用的话,点个「在看」让更多人看到。有问题评论区聊。

Original AI兴观点 程叙架构与AI.
Read more
内容效果不满意?点此反馈