Clipping 微信公众号

Codex 杀进 Chrome:操作你的浏览器,登录态可用

by AI兴观点 原文 ↗
Created: 2026-05-08

公众号名称:程叙架构与AI.

作者名称:AI兴观点

发布时间:2026-05-08 14:10

原文链接:https://developers.openai.com/codex/app/chrome-extension

✅点击上方🔺公众号🔺关注我✅

Codex 现在可以直接操作你的 Chrome 了——而且用的是你已登录好的账号。

不是模拟点击,不是脚本录制。它会在后台跨标签页并行干活,不抢你的浏览器前台。填表单、查后台、录 CRM、搜资料、更新数据——这些在浏览器里重复的劳动,现在直接口头描述给 Codex 就行。

但真正有意思的地方,是它跟之前那些「AI 浏览器」的做法完全不一样。

跟 Operator 们最大的区别:它用的是你的浏览器

Anthropic 的 Computer Use、OpenAI 自家的 Operator、Comet、Dia、Atlas——都在做同一件事:让 AI 替你操作网页。

但之前的做法都有一个共同问题:AI 开的是一个全新、干净的浏览器实例。

你的公司内网、CRM、Notion、Gmail 里登录的状态,AI 一概拿不到。它要替你干活,就得现场重新输密码、过验证码、走 SSO。

Chrome 插件这条路绕开了这个问题。你的 Chrome 里已经登录了 Gmail、Notion、Linear、内部后台,Codex 直接借用这些已登录的会话,等于给 AI 开了一个授权代办的入口。

OpenAI 官方给的一个示例任务很能说明问题:

查一下我最近 Portland 旅行有哪些餐饮报销,把它们加到我的 Navan 报销单里。相关收据可以在 ~/Desktop/receipts 里找。

这个任务横跨了 Gmail(找邮件里的收据信息)、Navan(公司报销系统,需要登录)、本地文件系统(读桌面上的收据)。一个全新打开的浏览器是干不了这件事的。

后台并行,不打扰你

如果你试过让某些 AI Agent 在你浏览器里接管鼠标键盘,就知道那感觉——任务没跑完之前,这台电脑基本就废了,连切个微信都不敢动。

Codex 这次的做法不一样。它会把每个任务放进独立的任务标签组里,你在主窗口干你的活,它在后面新开标签页自己跑。两边互不干扰,进度条在侧边栏能看到。

OpenAI 还展示过一个例子:让 Codex 同时打开 4 个 ChatGPT 标签,分别画 4 个不同风格的灯塔素描,并行跑。每个任务一个标签页,互不影响。

这套工作模式更接近「把任务派出去」而非「AI 借走我电脑」。

底层怎么跑的

早期那些浏览器 Agent 纯靠截图 + 点坐标,Codex 在 Chrome 里干活的方式是写代码并运行代码——写脚本、调 DOM、发请求。视觉那一层只在必要的时候才用。

纯视觉方案听着通用,但实际跑起来慢、成本高、还不稳,碰到结构化页面经常误判。在开发者熟悉的网页结构(表单、表格、API 调用)上,代码路线效率要高得多。

而且任务需要多个工具时,Codex 会自己挑最合适的那个:简单调 API 用插件,需要登录的走 Chrome,该组合就组合,该切换就切换。

一个实测:4 分钟扫完一周社区反馈

OpenAI 放了一个实测过程,看看这玩意儿实际能跑多快。任务是:去 OpenAI 开发者社区论坛扫一遍最近一周关于 Codex 的帖子,提炼用户反馈和核心问题,整理成表格。

整个过程在侧边栏滚动展示,4 分 8 秒跑完:

  • 先尝试调用论坛搜索接口,被 Chrome 客户端拦截
  • 切换到渲染版搜索页继续
  • 直接抓 DOM 链接超时,缩小范围重连
  • 拿到 4 月 28 日到 5 月 5 日的 68 条结果
  • 挑出高信号的帖子展开看,做交叉验证
  • 输出表格

如果你之前手工干过类似的活——比如调研对手社区反馈、定期扫 GitHub Issue——应该能理解这个速度意味着什么。

三层权限控制

默认情况下,Codex 访问每个新网站都会先弹一个确认框。你可以选:

  • 允许本次 —— 只当前对话能用
  • 永久允许 —— 以后不再问
  • 拒绝 —— 这个网站不让进

在 Computer Use 设置里可以统一管理白名单和黑名单。白名单里的域名直接过,黑名单的想都别想。

有一个高风险开关叫「总是允许浏览器内容」,开了以后 Codex 不再需要任何确认。默认是关的,不建议开。

浏览器历史也一样——Codex 想用的时候会先问你,而且没有「总是允许」选项,每次都要问。

怎么装

  1. 打开 Codex 设置 → Plugins,添加 Chrome 插件
  2. 跟着引导装扩展、同意权限弹窗
  3. 打开 Chrome,确认扩展显示 Connected

装好关掉当前线程,新开对话就能用。

权限和数据安全

安装时 Chrome 会列一串扩展权限,包括「读取和修改所有网站数据」。听起来吓人,但这是 Chrome 扩展层面的声明,实际使用时 Codex 有自己的双层权限控制(会话级确认 + 白名单/黑名单),不是装了扩展就全开。

关于数据存储,官方说得很清楚:不存浏览器操作的完整记录。 只有进入对话上下文的内容才会保留——比如 Codex 读到的页面文字、截图、工具调用。操作过程本身不会单独存一份日志。

如果 Chrome 任务需要上传你电脑里的文件,在扩展管理页打开「允许访问文件 URL」就行。

连不上怎么办

按这个顺序查:扩展显示 Connected 吗?插件开启了吗?Chrome profile 用对了吗?换个新线程试试?重启 Chrome 和 Codex 试试?都不行就去 Codex 跑 /feedback

跟内置浏览器有什么区别

对比项之前的内部浏览器现在的 Chrome 扩展
登录态要重新输入密码直接用你已登录的账号
多标签只能操作单个页面跨标签页并行
前台占用要切换过去看进度后台运行,不影响你
敏感操作直接执行提交/下载前先确认

从「Codex 自己有个浏览器」变成了「Codex 用你的浏览器」。

目前的主要短板

客观说几个限制。只支持 Chrome。 Edge、Brave、Arc 这些 Chromium 内核浏览器都不行。OpenAI 明确写了 “only with Chrome”。

权限要得猛。 安装包 109 KB,意味着重逻辑都在云端。插件权限范围基本等于你浏览器里的一切。对个人用户来说双层权限控制够用,但对有合规要求的企业,光权限这一条就够 IT 部门开几次会。

使用门槛。 部分地区无法直接装,需要曲线下载。账号本身也对一些市场有限制。

放在大图景里

把这次更新放回 OpenAI 这两年做的事情里看:

  • 早期推 Operator,验证「浏览器代理」这个形态
  • 随后把「看真实业务数据」的能力补进生态
  • ChatGPT 的 Atlas 模式让 AI 能跨工具调度
  • 现在的 Chrome 插件,把这一切搬进你已经登录、已经在用的浏览器

OpenAI 不打算再造一个浏览器。它的策略是:Chrome 你接着用,AI 我塞进去。

一个 AI agent 从「能写代码」到「能操作你的浏览器」——写代码对应的是开发工具链,操作浏览器对应的是整个互联网。中间的跨度,比看起来大。

觉得有用的话,点个「在看」让更多人看到。有问题评论区聊。


cover_image

Original AI兴观点 程叙架构与AI.

Read more


内容效果不满意?点此反馈

输入关键词开始搜索