在座的Computer Use都用错了!Anthropic 刚出的最佳实践给出了想不到的答案
公众号名称:程叙架构与AI.
作者名称:AI兴观点
发布时间:2026-05-15 00:10
原文链接:https://claude.com/blog/best-practices-for-computer-and-browser-use-with-claude
✅点击上方🔺公众号🔺关注我✅
Anthropic 官方刚刚放出了一篇长文,系统总结了用 Claude 做 Computer Use 和 Browser Use 的最佳实践,发现干货不少,整理一下分享出来。
做 Browser Agent 的点不准?问题可能不在模型智商
「很多 Agent 点不准,问题经常不在模型智商,而在截图和坐标没对上。」

你调了半天的 prompt、换了各种模型,结果卡在最基础的事上——鼠标没点到该点的位置。
Anthropic 这篇把坑都摆出来了,最有价值的东西集中在三块:截图怎么处理、思考量怎么调、长篇任务怎么管上下文。
1280x720 是一切的基础
做 Computer Use 先把截图分辨率设成 1280x720。
Claude 4.6 系列 API 有图片处理限制——最长边 1568 像素,总像素 1.15MP。超过限制的图 API 会偷偷缩图,但你的坐标体系不变。
模型看到的画面和你以为它看到的,根本不是一个版本。
坐标错位就是这么来的。
1280x720 占了大约 80% 的像素预算,在两个维度上都稳稳不超限,是训练中常见的标准分辨率。如果在用 Opus 4.7,上限更高(最长边 2576,总像素 3.75MP),可以从 1080p 起步。
Anthropic 还提供了一个 compute_max_api_fit 函数,能根据原始图片的宽高比算出刚好填满 API 预算的最大分辨率。适合追求极致的场景,但对大部分人来说,1280x720 已经够用。
还有三个细节比你想的重要
1. 先给指令,再给截图
很多人习惯先传截图再传文字指令。官方测下来,反过来效果更好。模型先读到「点击提交按钮」再去看图,比先看图再读指令更精准。
# ✅ 推荐:文字指令在前,截图在后
content = [
{"type": "text", "text": "点击提交按钮"},
{"type": "image", "source": {"type": "base64", "media_type": "image/png", "data": screenshot_b64}},
]
2. 坐标要缩放回去
你发给模型的是缩图,模型返回的坐标也是缩图坐标系下的。别忘了按缩放比例换算回真实屏幕分辨率。
scale_x = screen_w / display_w
scale_y = screen_h / display_h
screen_x = int(api_returned_x * scale_x)
screen_y = int(api_returned_y * scale_y)
这步漏了,点永远歪。
3. 小按钮的攻略
复选框、系统托盘图标、下拉箭头这些微小的点击目标,是所有 Computer Use 模型的共同难题。Anthropic 给了三个建议:
- 打开
enable_zoom: True,让模型能先放大再看清再点 - 能用键盘快捷键的地方,别用鼠标
- 如果 UI 是你控制的,放大按钮尺寸
思考量不是越高越好
Claude 最新模型支持自适应思考(Adaptive Thinking),可以动态分配推理预算。但你猜怎么着?在 Computer Use 场景下,更多的思考未必更好。
官方的测下来数据很有意思:
对 Claude 4.6 系列:
- Medium 级别是最优性价比。用高(High)大约一半的 token,就能达到接近最高的任务成功率
- 加上重试机制后,Medium 和 High 最终成功率一致
- Low 也比关闭思考更准——因为犯的错少了,重试次数也少了
- 不推荐 Max——UI 操作主要是感知和机械动作,不是深度逻辑推理,多出来的思考预算根本用不上
Claude 4.6 系列不同思考级别下 OSWorld 任务成功率的对比
对 Opus 4.7:
- High 级别是甜点——接近最高成功率,只用一半的 token
- Low 级别的表现就已经超过 4.6 系列的 High
- OSWorld 测试中,Opus 4.7 在 Low 思考量下,与 Sonnet 4.6 在 Max 思考量下得分相当,而 token 用量只有十分之一
Opus 4.7 不同思考级别下 OSWorld 任务成功率的对比
反直觉对吧?Computer Use 跟写代码不一样——大部分动作就是「看到按钮 → 点下去」的机械流程,不需要深度思考。脑子转太多了反而坏事。
长任务的上下文管理
做 Agent 的人都懂这个问题:截图一张接一张地堆,200k 的上下文窗口撑不了多久。
一张截图大概 1000-1800 token,算上 system prompt 和 tool 定义,不到 100 张截图就能塞满。
Anthropic 推荐了三层策略:
1. Cache Breakpoints 放对位置
API 支持 4 个缓存断点。一个放在系统 prompt 上(极少变化),剩下三个放在最近的 tool result 上,每轮清掉重放。这样即使最新断点失效了,前面的还能命中,至少能省 90% 的输入费用。
2. 滚动缓冲——批量裁图,不是逐帧裁
最土的办法是只保留最近 N 张截图,但逐帧删除会导致缓存不断失效。正确的做法是按批裁剪:保留最后 3 张,当总数超过 3 + 25 时,一次把最旧的 25 张替换成占位符。这样缓存能连续命中 25 个回合。
3. 压缩(Compaction)——该舍舍
纯截图滚动的问题是,旧截图丢了,上下文也丢了——原始指令、已完成的步骤、当前进度,全都没了。
解决方案是用 LLM 把历史压缩成摘要。Anthropic 提供了一个超级详细的压缩 prompt,包含 8 个维度:用户指令、已做动作、失败记录、当前状态、下一步该做什么……
API 现在还支持服务端自动压缩(Beta),设一个触发阈值(比如 150k token),到了就自动压缩,你只需要传一个自定义的压缩 prompt。
response = client.beta.messages.create(
model="claude-opus-4-7",
max_tokens=16000,
betas=["compact-2026-01-12", "computer-use-2025-11-24"],
context_management={
"edits": [{
"type": "compact_20260112",
"trigger": {"type": "input_tokens", "value": 150_000},
"instructions": COMPACT_PROMPT,
}]
},
)
Prompt Injection 保护,默认就开了
Computer Use Agent 天然接触不受信内容——每个网页、每个弹窗都可能藏了对抗性指令。Anthropic 在这块做了三件事:
- 训练时加固:在 RL 训练中让 Claude 接触到各种注入攻击,学会分辨合法指令和恶意内容
- 实时分类器:在请求中并行运行注入检测,零额外延迟和成本
- 持续红队测试:每个新模型都强化防御
如果你是用的官方 computer_20251124 tool,这些保护默认就开了,不需要任何配置。
如果你自己写了 custom tool 来做截图和点击,那这些分类器还不会在 custom tool 上自动运行。Anthropic 正在扩展支持,有兴趣的可以填个表单。
另外,官方还提醒了几条谁都适用的安全建议:高危操作(提交表单、付款、发消息)最好加人工确认环节,给 Agent 的权限尽量缩到最小,别一上来就给全量权限。
几个官方替你试了但没用的事
Anthropic 还专门列了几项他们内部测过但没用的常见优化,帮后来人省点时间:
- 截图切成小块分开送 → 没用。别费心切图了,一张完整的缩过尺寸的截图效果最好
- 在截图上叠坐标网格 → 没用。加了格子也帮不了模型定位
- 换不同的缩放算法(LANCZOS vs sips 之类)→ 结果一样。用啥方便就用啥
以及一个 Mac 用户最容易踩的坑:MacOS 截图默认 DPR(设备像素比)=2,你看着是 1920x1080,实际发给 API 的是 2x 分辨率。如果你不做额外缩放,截图轻松超限。Claude 4.6 系列的读者尤其注意——1920x1080 的 2x 截图已经超 1.15MP 限制了,API 会偷偷缩图,你的坐标系全乱。
几个实验性但值得关注的方向
文章里还提了几个有意思的实验性功能:
Batch Tools 把一连串机械动作打包成一次调用,而不是 N 次往返。比如一次 computer_batch 调用完成「点击 → 输入 → 按键」三个动作。适合连续填表或已知路径的流程,不适合探索性导航。
Advisor Tool 一个「执行器 + 顾问」模式。主力是 Sonnet 4.6 负责跑循环,遇到需要深度推理的时刻可以召唤 Opus 4.7 给出建议。这在长任务上效果显著——大部分点击动作很机械,但偶尔的规划时刻需要更强的大脑。
Show, Don’t Tell 这个最有意思——不是用文本描述流程让 Claude 理解,而是直接录屏演示一遍。Claude 在看录制画面时,不仅能看到操作顺序,还能看到屏幕状态的变化,并自适应调整到当前 UI 的差异。
官方已经把这套模式的参考实现开源了: 👉 https://github.com/anthropics/claude-quickstarts/tree/main/computer-use-best-practices
模型怎么选
最后贴一下官方的模型选择建议:
| 场景 | 推荐模型 | 原因 |
|---|---|---|
| 默认大多数场景 | Sonnet 4.6 | 点击精准度最高 + 推理够用 + 成本友好 |
| 复杂单次任务 | Opus 4.7, thinking=high | 推理更强,高分辨率支持更好 |
| 延迟敏感 | Haiku 4.5 | 反应最快 |
| 极致推理 + 高精度 | Opus 4.7 + Sonnet 4.6 配对 | Advisor Tool 模式 |
完整 demo 在 GitHub 上,batch tools、advisor tool、坐标缩放、缓存管理全实现了,直接能跑。
https://github.com/anthropics/claude-quickstarts/tree/main/computer-use-best-practices
如果觉得这篇文章有帮助,欢迎点赞、在看、转发!有问题也可以在评论区留言,我会尽量回复!

Original AI兴观点 程叙架构与AI.
Read more
内容效果不满意?点此反馈