Codex 的 Computer Use、Chrome 插件、应用内浏览器三种操作模式各有适用场景,本文拆解权限体系并给出最佳实践。


Codex 的 Computer Use、Chrome 插件、应用内浏览器三种操作模式各有适用场景,本文拆解权限体系并给出最佳实践。
OpenAI 工程师 Jason Liu 分享了一个案例:网购快递被偷,联系客服预计等待 25 分钟。他把这件事交给 Codex,指令是「每 5 分钟检查一次聊天窗口,如果客服上线改成每分钟检查,尽量帮我完成退款」,然后去洗澡了。回来时,退款已经办完。这背后是 Codex 的三种「电脑操作能力」——Computer Use、Chrome 插件、应用内浏览器。它们看起来功能重叠,实际上对应的是一套精心设计的行动权限体系。
这三个模式都是让 Codex 接管电脑的能力,但权限范围和适用场景完全不同。简单来说:能用插件就不要点网页,能直接调用 API 就别让 AI 用识屏操作界面。

能力最大的模式。它能看屏幕、操作几乎任何图形界面、用键盘和菜单、跟你授权过的 App 打交道。没有 API 的软件它照样能用,完全依靠「看着屏幕,自己判断该点哪」。

代价是慢。 结构化的插件可以直接调一个接口,Computer Use 得先看清界面、判断点哪、等 App 反应、再看下一屏,这个视觉循环相当浪费时间。
适用场景:
💡 提示:一次只给它一个明确的 App 或流程。碰到钱、账户、密码、隐私、系统安全的操作,守在旁边。
接管的是你已经登录好的浏览器。Cookie、配置、登录态、开着的标签页,这些它都能用。Gmail、LinkedIn、Salesforce、公司内部后台,这类需要登录才能访问的网页信息,可以交给 Chrome 来完成。
谷歌发布120亿参数开源多模态模型,支持文本、图像、音频输入,仅需9GB显存即可在笔记本本地运行,Apache 2.0协议。
关键差别:由于 Chrome 使用带着你的身份,网站会把它的点击、提交、发消息当成你本人在操作。能力更强,风险也更大。
适用场景:
在 Codex 的对话里,你和它看的是同一个渲染出来的页面。不会使用你平时的浏览器配置、不带 Cookie、没有插件、没有登录态。
适用场景:
最有意思的是批注功能:审核本地页面时,直接点某个元素或圈出一块区域,留一句话「这个层级反了」「这块别做成卡片」。Codex 会收到带着截图和元素上下文的评论,改完文件再把同一个页面打开给你看下一版。
OpenAI 自己的最佳实践指向一个反直觉的方向:像人一样点击,是最慢、最脆弱、信任成本最高的那条路。真正想要的是给 Agent 足够结构化的接口,让它尽量用不着去点。
| 场景 | 推荐模式 | 原因 |
|---|---|---|
| 操作原生桌面 App | Computer Use | 没有 API,只能靠视觉操作 |
| 需要登录的网页任务 | Chrome 插件 | 带登录态,网站当你是本人 |
| 本地开发和调试 | 应用内浏览器 | 干净隔离,可批注 |
| 跨多个 App 切换 | Computer Use | 只有它能跨应用 |
| 结构化集成中缺一步 | Computer Use | 补位,点一下「添加文件」 |
第四项相关功能是 Appshots。在 macOS 平台上,任何场景同时按下空格键左右两边两个 Command 键,就会自动把窗口截图、窗口上下文信息一起发给 Codex。
Appshots 负责指,Browser、Chrome、Computer Use 负责动手。你用 Appshots 告诉 Codex「看这里」,然后让合适的操作模式去执行。