Computer Use Agent:当 AI 学会看着屏幕操作电脑

3651 字
18 分钟
Computer Use Agent:当 AI 学会看着屏幕操作电脑

2026-08-20 Computer Use Agent:当 AI 学会”看着屏幕操作电脑”——拆解 GUI Agent 从 RPA 到混合动作的演进#

📅 学习日期:2026-08-20 | 📚 来源:AI Agent 知识库 | 📝 综合文章数:5 篇

🎯 为什么选这个主题#

8-03 学了 Tool Use,8-11 学了 Coding Agent——它们走的是”API / CLI”路径,通过结构化接口调用工具。但现实世界中,绝大多数软件没有 API,大量工作流被困在图形界面里。Computer Use Agent(CUA / GUI Agent)走的是另一条路:让 AI 像人一样看屏幕、点按钮、填表单。

2025 年 OpenAI 发布 Operator、Anthropic 推出 Claude Computer Use、Google 推出 Project Mariner——三大巨头同时押注 GUI Agent,这不是巧合,而是一个信号:Agent 正从”能对话”走向”能动手”。

今天拆解 GUI Agent 的技术架构、混合动作创新、CLI vs GUI 的范式抉择,以及它面临的严峻安全挑战。


📌 核心要点一:从 RPA 到 GUI Agent 的三代演进#

阶段驱动力代表核心能力核心缺陷
第一代:规则自动化宏脚本、录制回放、RPAUiPath、Automation Anywhere按固定坐标/元素 ID 操作维护成本高、无语义理解、泛化差
第二代:ML 增强CV + NLP + RLRoScript、AppFlow、Humanoid有一定环境感知与决策需大量标注、泛化有限
第三代:LLM 驱动多模态大模型Operator、Claude CUA、Agent S2端到端自然语言理解+视觉解析执行安全性、隐私风险、幻觉操作

范式跃迁的关键:从”基于规则”到”基于理解与推理”。第三代 GUI Agent 不再依赖预定义的 UI 路径,而是像人一样看屏幕→理解状态→规划动作→执行操作→观察结果。

但这里有一个反直觉的现实:OpenAI CUA 在 OSWorld 上的成功率只有 38.1%,而人类是 72.4%。即使是最先进的 CUA,每 3 次操作就有近 2 次会失败——GUI Agent 离”可用”还有距离。


📌 核心要点二:GUI Agent 核心架构——感知-推理-行动闭环#

五大组件架构#

┌────────────────────────────────────────────────┐
│ 记忆(Memory) │
│ 短期:当前任务上下文 长期:历史轨迹 + RAG │
├────────────────────────────────────────────────┤
│ 提示工程(Prompt Engineering) │
│ 用户请求 + Agent指令 + 环境状态 + 演示范例 │
├────────────────────────────────────────────────┤
│ 模型推理(Model Inference) │
│ LLM 作为"大脑":规划、行动推理、自我修正 │
├────────────────────────────────────────────────┤
│ 操作环境(Operating Environment) │
│ 截图 / UI结构树 / CV辅助感知 │
├────────────────────────────────────────────────┤
│ 动作执行(Action Execution) │
│ UI操作 / 原生API调用 / AI工具调用 │
└────────────────────────────────────────────────┘

CUA 三步工作流(OpenAI Operator)#

  1. 感知(Perception):实时截取屏幕快照,作为上下文输入模型
  2. 推理(Reasoning):通过 Chain-of-Thought 逐步规划操作步骤,根据视觉变化实时调整与自我修正
  3. 操作(Action):控制鼠标键盘执行操作,遇敏感操作(登录、验证码)主动寻求用户确认

典型演示:用户说”订今晚 7 点 Beretta 双人位”→ Operator 打开浏览器搜索 → 发现默认地址错误(弗吉尼亚)→ 自动修正为旧金山 → 完成预订。这种灵活纠错能力是传统 RPA 完全做不到的。

7 大代表性 CUA 一览#

CUA出品方核心差异点
Agent S2Simular AIOSWorld 15/50 步评估一流,开源
Genspark SuperagentMainFuncMoA 架构(9+ 模型混合),80+ 内置工具
AceGeneral Agents观察人类学习复制,左键预测正确率 77.56%
Proxy AIConvergence AI并行处理,多个代理同时处理子任务
OWLCAMEL-AI开源多代理框架,支持本地运行
Manus AIManusLinux 沙箱运行,异步任务,云连续性
Claude Computer UseAnthropic跨应用工作流,网络导航

📌 核心要点三:UltraCUA 的混合动作创新——GUI + 程序化调用#

核心问题:纯 GUI Agent 靠点击和输入操作,执行链长、易累积错误。UltraCUA 提出了破局方案——混合动作(Hybrid Action)机制。

混合动作是什么?#

传统 GUI Agent: 点击菜单 → 点击子菜单 → 点击选项 → 确认 (4步,每步可能出错)
UltraCUA: 调用 vscode.set_theme("dark") (1步,确定性高)
  • 低级 GUI 操作:点击、输入、滚动——通用但链长易错
  • 高级程序化调用:Python 函数、键盘快捷键、组合原语——高效但需先发现工具

Agent 不再二选一,而是根据任务上下文战略式切换:程序化接口能提升效率时调用工具,需要通用覆盖时保留 GUI 交互。

自动化工具收集:881 个工具从哪来?#

来源方法示例
软件文档提取从应用文档抽取专家知识VS Code 文档 → vscode.set_theme()
开源实现集成引入 AgentS2 等框架工具复杂 GUI 序列转为高效程序调用
编码代理自动扩展编码代理写脚本 → LLM 提炼为函数Python/Bash 脚本 → 带参数的可复用工具

两阶段训练 + 合成数据#

  1. SFT 阶段:多代理系统(Planner o3 + Grounder GTA1-7B)做 8 次 rollout,收集 26.8K 成功混合轨迹
  2. RL 阶段:选难度 [0.4, 0.8] 的任务,GRPO 变体训练,奖励 = 环境奖励 + 工具使用奖励(0.3),鼓励 Agent 战略性地选择混合路径

性能表现#

基准UltraCUA-7B基线相对提升对比
OSWorld 15步28.9%23.4%+23.5%超越 Claude 3.7(27.1%)
UltraCUA-32B41.0%——超越 OpenAI CUA(26.0%)
WindowsAgentArena21.7%13.5%~18.1%+20%无 Windows 特定训练

💡 关键发现:混合动作使成功率从 23.4% → 27.0%(+15.4% 相对),RL 再带来 7% 相对提升。工具使用随模型能力增加而更频繁多样——越强的模型越善于”走捷径”。


📌 核心要点四:CLI vs GUI——不是谁取代谁,而是谁更适合谁#

这是今天最有实战价值的一个要点。当企业要部署 Agent 时,第一个架构决策就是:走 CLI/API 路径,还是 GUI 路径?

CLI 的三大优势#

优势原因适合场景
确定性命令回显明确,成功/失败清晰,Agent 无需判断屏幕状态数据处理、代码运维、SaaS 集成
高吞吐命令易组合串联,可重复上万次,低成本可审计高频并发调度、批量任务
训练分布友好预训练见过大量 shell/日志/命令,理解命令比理解界面更成熟几乎所有标准化任务

GUI 的四大不可替代场景#

场景为什么 GUI 不可替代示例
接口真空区遗留系统无开放 API,改造预算不够老版 ERP、内部审批系统
视觉型任务需理解画面、布局与创意反馈图像处理、三维设计、视频编辑
Web/移动端跳转业务链条散落多表单与跳转中,直接适配成本高复杂表单核验、前端验证
角色定位长尾覆盖与”最后一公里”执行探索性、临时、低频流程

💡 核心洞察:竞争力不在”会不会做”,而在”会不会选最合适的做法”。最强 Agent 应具备跨模态操作能力,自动基于代价与成功率切换路径——该走接口走接口,该进界面进界面,需人工确认则停下。


📌 核心要点五:挑战与未来——安全、泛化与分层迁移#

四大严峻挑战#

挑战核心风险严重程度
隐私与数据安全需获取截图、凭证等敏感信息,传至远程处理易泄露🔴 高
执行安全与可靠性误操作可致数据损坏/崩溃,LLM 输出不确定易生错误动作🔴 高
跨平台泛化面对训练外的新布局/逻辑/版本,鲁棒性不足🟡 中
人机交互冲突用户自发行为干扰 Agent 操作,弹窗增加复杂度🟡 中

为什么隐私问题最严重? GUI Agent 必须”看到”屏幕才能操作——这意味着你的银行密码、私密聊天、商业报表都在它的”视线”内。传统 API Agent 只传必要参数,GUI Agent 却要传整张截图。这是结构性风险,不是优化能解决的。

分层迁移策略:从 GUI 到 CLI 的渐进路线#

┌─────────────────────────────────────────┐
│ 上层:GUI Agent 打通暂不能接口化的系统 │ ← 长尾覆盖、探索性任务
├─────────────────────────────────────────┤
│ 中层:高频动作封装为 Skill / 命令集合 │ ← 验证有效后下沉
├─────────────────────────────────────────┤
│ 底层:原子能力与权限边界 │ ← 核心:API/CLI/Skill
└─────────────────────────────────────────┘
迁移逻辑:高频稳定任务 → 从 GUI 下沉为 API/CLI/Skill
GUI 永远作过渡层、覆盖层、专用层

这与 UltraCUA 的混合动作设计完全一致:先用 GUI Agent 发现操作路径,验证有效后将高频路径封装为程序化工具,逐步从 GUI 迁移到 CLI。GUI Agent 的终极目标,是让一部分 GUI Agent 不再需要。

未来三大方向#

  1. 多模态感知与融合:融合视觉+文本,提升动态界面交互能力
  2. 跨平台泛化与通用架构:统一环境抽象与动作映射,元学习增强多系统适配
  3. 本地化推理减风险:在设备端执行视觉理解,减少截图上传的隐私泄露

🔄 分歧与讨论#

分歧一:纯 GUI Agent vs 混合动作——两条技术路线的选择#

  • 纯 GUI 路线(OpenAI Operator、Claude CUA):坚持”像人一样操作”,通用性强,但执行链长、易出错
  • 混合动作路线(UltraCUA):GUI + 程序化调用,效率高、错误少,但需先发现/收集工具

我的判断:混合动作路线是必然方向。纯 GUI 是起点,但长期来看,任何重复高频的 GUI 操作最终都会被封装为程序化调用。这就像人类用户也会给常用操作设快捷键——AI Agent 也应该这样做。UltraCUA 的 881 个工具收集流水线,本质上是在做”Agent 的快捷键发现”。

分歧二:GUI Agent 真的能取代 RPA 吗?#

  • 支持方:GUI Agent 有语义理解能力,不再依赖固定坐标,泛化远超 RPA
  • 反对方:GUI Agent 成功率只有 38%(OSWorld),而 RPA 虽然笨但稳定可靠;企业级场景宁可笨但可靠,不要聪明但不可控

我的判断:短期不会取代,长期会融合。RPA 的可靠性与 GUI Agent 的灵活性需要结合——先用 GUI Agent 探索路径,验证稳定后下沉为 RPA 式的确定性脚本。这不是”取代”的故事,而是”GUI Agent 发现路径 → 自动生成 RPA 脚本”的闭环。


🔗 与已学内容的联系#

已学主题与 Computer Use Agent 的联系
8-03 Tool UseGUI Agent 本质是用”GUI”作为工具——一种非结构化的工具调用方式
8-11 Coding AgentCoding Agent = CLI 路径的代表,GUI Agent = 视觉路径的代表,两者互补
7-24 记忆GUI Agent 的短期记忆(当前操作状态)+ 长期记忆(历史轨迹 RAG)
7-29 Multi-AgentGenspark 的 MoA 架构(9+ 模型混合)、OWL 的多代理协作
8-17/8-18 HarnessGUI Agent 的沙盒隔离(Manus 的 Linux 沙箱)是 Harness E 层的实例
8-05 安全GUI Agent 面临最严峻的隐私安全挑战——截图含敏感信息
8-07 HITLCUA 遇敏感操作主动寻求用户确认——GUI Agent 的 HITL 天然断点更多
8-06 MCPUltraCUA 的程序化工具调用与 MCP 协议的互补关系
7-27 Skill高频 GUI 操作封装为 Skill 后向 CLI 迁移——分层策略的中层
8-04 PlanningCUA 的 CoT 推理本质是 Planning——看屏幕→规划→执行→观察
8-13 产品设计GUI Agent 的 UX 设计(实时显示执行步骤、信任透传)
8-19 Deep ResearchGUI Agent 作为”浏览器自动化”工具是 DR Agent 的核心组件之一

📌 一句话收口:8-03 Tool Use 是”Agent 会用工具”,8-11 Coding Agent 是”Agent 会写代码”,而 Computer Use Agent 是”Agent 会操作电脑”——这是从”接口世界”到”视觉世界”的跨越,也是 Agent 真正走入每个人工作流的最后一公里。


🤔 思考题#

  1. 安全架构设计题:如果你要设计一个 GUI Agent 的安全架构,如何确保截图中的密码、商业数据不被泄露?本地推理 vs 远程推理 vs 可信执行环境(TEE),各有什么权衡?
  2. 混合动作决策题:UltraCUA 的混合动作让 Agent 自主选择”走 GUI 还是走 API”。如果 Agent 选错了路径(比如该用 API 时却点了 GUI 按钮,效率极低),你如何设计反馈机制让它下次选对?
  3. 分层迁移实操题:你的公司有 50 个日常业务流程,其中 30 个有 API、20 个只能用 GUI 操作。你会如何设计迁移策略?哪些先做 CLI 自动化?哪些用 GUI Agent 先跑起来?哪些保持人工?
  4. 未来预测题:如果 2027 年 GUI Agent 的成功率从 38% 提升到 80%(接近人类水平),RPA 行业会怎样? 传统的 RPA 公司(UiPath 等)是转型还是消亡?

🛠️ 行动项#

  1. 用 Playwright 构建一个最小 Web GUI Agent 原型:实现”截图→LLM 推理→执行操作”的闭环,对任意网页完成一个简单任务(如搜索并点击某个链接),记录成功率。
  2. 对比 CLI vs GUI 路径的效率差异:同一个任务(如”在 GitHub 上创建一个 repo”),分别用 GitHub API(CLI 路径)和 Playwright 浏览器自动化(GUI 路径)实现,对比代码量、执行时间、错误率。

📚 参考文章#

  1. GUI Agent 综述:从传统自动化到多模态大模型驱动的智能体 — 全面综述视角:三代演进路径、五组件架构、提示工程、记忆机制、四大挑战与三大方向
  2. 7 大计算机使用代理(CUA) — 产品总览视角:7 个代表性 CUA 的核心差异与能力对比
  3. Operator 背后的技术:Computer-Using Agent(CUA) — OpenAI 深度拆解:CUA 三步工作流、性能基准、OpenAI 五级发展路线图
  4. UltraCUA:A Foundation Model for Computer Use Agents with Hybrid Action — 学术创新视角:混合动作机制、881 工具自动收集、17K+ 合成数据、SFT+RL 两阶段训练、OSWorld 41.0% 登顶
  5. AI Agent 交互形态演进:图形界面与命令行 — 范式比较视角:CLI 三大优势、GUI 四大不可替代场景、企业选型四维度、分层迁移策略

📅 2026-08-20 | 第 19 篇每日学习笔记

文章分享

如果这篇文章对你有帮助,欢迎分享给更多人!

Computer Use Agent:当 AI 学会看着屏幕操作电脑
https://www.zgf.me/posts/2026-08-20-computer-use-agent/
作者
赵某人
发布于
2026-08-20
许可协议
CC BY-NC-SA 4.0

评论区

Profile Image of the Author
赵某人
俯视泥土,仰望星辰
公告
欢迎来到我的博客!这是一则示例公告。
分类
标签
最新动态
站点统计
文章
28
分类
1
标签
58
总字数
129,420
运行时长
0 天
最后活动
0 天前
站点信息
构建平台
Local
博客版本
Firefly v6.14.5
文章许可
CC BY-NC-SA 4.0