Computer Use Agent:当 AI 学会看着屏幕操作电脑
2026-08-20 Computer Use Agent:当 AI 学会”看着屏幕操作电脑”——拆解 GUI Agent 从 RPA 到混合动作的演进
📅 学习日期:2026-08-20 | 📚 来源:AI Agent 知识库 | 📝 综合文章数:5 篇
🎯 为什么选这个主题
8-03 学了 Tool Use,8-11 学了 Coding Agent——它们走的是”API / CLI”路径,通过结构化接口调用工具。但现实世界中,绝大多数软件没有 API,大量工作流被困在图形界面里。Computer Use Agent(CUA / GUI Agent)走的是另一条路:让 AI 像人一样看屏幕、点按钮、填表单。
2025 年 OpenAI 发布 Operator、Anthropic 推出 Claude Computer Use、Google 推出 Project Mariner——三大巨头同时押注 GUI Agent,这不是巧合,而是一个信号:Agent 正从”能对话”走向”能动手”。
今天拆解 GUI Agent 的技术架构、混合动作创新、CLI vs GUI 的范式抉择,以及它面临的严峻安全挑战。
📌 核心要点一:从 RPA 到 GUI Agent 的三代演进
| 阶段 | 驱动力 | 代表 | 核心能力 | 核心缺陷 |
|---|---|---|---|---|
| 第一代:规则自动化 | 宏脚本、录制回放、RPA | UiPath、Automation Anywhere | 按固定坐标/元素 ID 操作 | 维护成本高、无语义理解、泛化差 |
| 第二代:ML 增强 | CV + NLP + RL | RoScript、AppFlow、Humanoid | 有一定环境感知与决策 | 需大量标注、泛化有限 |
| 第三代:LLM 驱动 | 多模态大模型 | Operator、Claude CUA、Agent S2 | 端到端自然语言理解+视觉解析 | 执行安全性、隐私风险、幻觉操作 |
范式跃迁的关键:从”基于规则”到”基于理解与推理”。第三代 GUI Agent 不再依赖预定义的 UI 路径,而是像人一样看屏幕→理解状态→规划动作→执行操作→观察结果。
但这里有一个反直觉的现实:OpenAI CUA 在 OSWorld 上的成功率只有 38.1%,而人类是 72.4%。即使是最先进的 CUA,每 3 次操作就有近 2 次会失败——GUI Agent 离”可用”还有距离。
📌 核心要点二:GUI Agent 核心架构——感知-推理-行动闭环
五大组件架构
┌────────────────────────────────────────────────┐│ 记忆(Memory) ││ 短期:当前任务上下文 长期:历史轨迹 + RAG │├────────────────────────────────────────────────┤│ 提示工程(Prompt Engineering) ││ 用户请求 + Agent指令 + 环境状态 + 演示范例 │├────────────────────────────────────────────────┤│ 模型推理(Model Inference) ││ LLM 作为"大脑":规划、行动推理、自我修正 │├────────────────────────────────────────────────┤│ 操作环境(Operating Environment) ││ 截图 / UI结构树 / CV辅助感知 │├────────────────────────────────────────────────┤│ 动作执行(Action Execution) ││ UI操作 / 原生API调用 / AI工具调用 │└────────────────────────────────────────────────┘CUA 三步工作流(OpenAI Operator)
- 感知(Perception):实时截取屏幕快照,作为上下文输入模型
- 推理(Reasoning):通过 Chain-of-Thought 逐步规划操作步骤,根据视觉变化实时调整与自我修正
- 操作(Action):控制鼠标键盘执行操作,遇敏感操作(登录、验证码)主动寻求用户确认
典型演示:用户说”订今晚 7 点 Beretta 双人位”→ Operator 打开浏览器搜索 → 发现默认地址错误(弗吉尼亚)→ 自动修正为旧金山 → 完成预订。这种灵活纠错能力是传统 RPA 完全做不到的。
7 大代表性 CUA 一览
| CUA | 出品方 | 核心差异点 |
|---|---|---|
| Agent S2 | Simular AI | OSWorld 15/50 步评估一流,开源 |
| Genspark Superagent | MainFunc | MoA 架构(9+ 模型混合),80+ 内置工具 |
| Ace | General Agents | 观察人类学习复制,左键预测正确率 77.56% |
| Proxy AI | Convergence AI | 并行处理,多个代理同时处理子任务 |
| OWL | CAMEL-AI | 开源多代理框架,支持本地运行 |
| Manus AI | Manus | Linux 沙箱运行,异步任务,云连续性 |
| Claude Computer Use | Anthropic | 跨应用工作流,网络导航 |
📌 核心要点三:UltraCUA 的混合动作创新——GUI + 程序化调用
核心问题:纯 GUI Agent 靠点击和输入操作,执行链长、易累积错误。UltraCUA 提出了破局方案——混合动作(Hybrid Action)机制。
混合动作是什么?
传统 GUI Agent: 点击菜单 → 点击子菜单 → 点击选项 → 确认 (4步,每步可能出错)UltraCUA: 调用 vscode.set_theme("dark") (1步,确定性高)- 低级 GUI 操作:点击、输入、滚动——通用但链长易错
- 高级程序化调用:Python 函数、键盘快捷键、组合原语——高效但需先发现工具
Agent 不再二选一,而是根据任务上下文战略式切换:程序化接口能提升效率时调用工具,需要通用覆盖时保留 GUI 交互。
自动化工具收集:881 个工具从哪来?
| 来源 | 方法 | 示例 |
|---|---|---|
| 软件文档提取 | 从应用文档抽取专家知识 | VS Code 文档 → vscode.set_theme() |
| 开源实现集成 | 引入 AgentS2 等框架工具 | 复杂 GUI 序列转为高效程序调用 |
| 编码代理自动扩展 | 编码代理写脚本 → LLM 提炼为函数 | Python/Bash 脚本 → 带参数的可复用工具 |
两阶段训练 + 合成数据
- SFT 阶段:多代理系统(Planner o3 + Grounder GTA1-7B)做 8 次 rollout,收集 26.8K 成功混合轨迹
- RL 阶段:选难度 [0.4, 0.8] 的任务,GRPO 变体训练,奖励 = 环境奖励 + 工具使用奖励(0.3),鼓励 Agent 战略性地选择混合路径
性能表现
| 基准 | UltraCUA-7B | 基线 | 相对提升 | 对比 |
|---|---|---|---|---|
| OSWorld 15步 | 28.9% | 23.4% | +23.5% | 超越 Claude 3.7(27.1%) |
| UltraCUA-32B | 41.0% | — | — | 超越 OpenAI CUA(26.0%) |
| WindowsAgentArena | 21.7% | 13.5%~18.1% | +20% | 无 Windows 特定训练 |
💡 关键发现:混合动作使成功率从 23.4% → 27.0%(+15.4% 相对),RL 再带来 7% 相对提升。工具使用随模型能力增加而更频繁多样——越强的模型越善于”走捷径”。
📌 核心要点四:CLI vs GUI——不是谁取代谁,而是谁更适合谁
这是今天最有实战价值的一个要点。当企业要部署 Agent 时,第一个架构决策就是:走 CLI/API 路径,还是 GUI 路径?
CLI 的三大优势
| 优势 | 原因 | 适合场景 |
|---|---|---|
| 确定性 | 命令回显明确,成功/失败清晰,Agent 无需判断屏幕状态 | 数据处理、代码运维、SaaS 集成 |
| 高吞吐 | 命令易组合串联,可重复上万次,低成本可审计 | 高频并发调度、批量任务 |
| 训练分布友好 | 预训练见过大量 shell/日志/命令,理解命令比理解界面更成熟 | 几乎所有标准化任务 |
GUI 的四大不可替代场景
| 场景 | 为什么 GUI 不可替代 | 示例 |
|---|---|---|
| 接口真空区 | 遗留系统无开放 API,改造预算不够 | 老版 ERP、内部审批系统 |
| 视觉型任务 | 需理解画面、布局与创意反馈 | 图像处理、三维设计、视频编辑 |
| Web/移动端跳转 | 业务链条散落多表单与跳转中,直接适配成本高 | 复杂表单核验、前端验证 |
| 角色定位 | 长尾覆盖与”最后一公里”执行 | 探索性、临时、低频流程 |
💡 核心洞察:竞争力不在”会不会做”,而在”会不会选最合适的做法”。最强 Agent 应具备跨模态操作能力,自动基于代价与成功率切换路径——该走接口走接口,该进界面进界面,需人工确认则停下。
📌 核心要点五:挑战与未来——安全、泛化与分层迁移
四大严峻挑战
| 挑战 | 核心风险 | 严重程度 |
|---|---|---|
| 隐私与数据安全 | 需获取截图、凭证等敏感信息,传至远程处理易泄露 | 🔴 高 |
| 执行安全与可靠性 | 误操作可致数据损坏/崩溃,LLM 输出不确定易生错误动作 | 🔴 高 |
| 跨平台泛化 | 面对训练外的新布局/逻辑/版本,鲁棒性不足 | 🟡 中 |
| 人机交互冲突 | 用户自发行为干扰 Agent 操作,弹窗增加复杂度 | 🟡 中 |
为什么隐私问题最严重? GUI Agent 必须”看到”屏幕才能操作——这意味着你的银行密码、私密聊天、商业报表都在它的”视线”内。传统 API Agent 只传必要参数,GUI Agent 却要传整张截图。这是结构性风险,不是优化能解决的。
分层迁移策略:从 GUI 到 CLI 的渐进路线
┌─────────────────────────────────────────┐│ 上层:GUI Agent 打通暂不能接口化的系统 │ ← 长尾覆盖、探索性任务├─────────────────────────────────────────┤│ 中层:高频动作封装为 Skill / 命令集合 │ ← 验证有效后下沉├─────────────────────────────────────────┤│ 底层:原子能力与权限边界 │ ← 核心:API/CLI/Skill└─────────────────────────────────────────┘
迁移逻辑:高频稳定任务 → 从 GUI 下沉为 API/CLI/Skill GUI 永远作过渡层、覆盖层、专用层这与 UltraCUA 的混合动作设计完全一致:先用 GUI Agent 发现操作路径,验证有效后将高频路径封装为程序化工具,逐步从 GUI 迁移到 CLI。GUI Agent 的终极目标,是让一部分 GUI Agent 不再需要。
未来三大方向
- 多模态感知与融合:融合视觉+文本,提升动态界面交互能力
- 跨平台泛化与通用架构:统一环境抽象与动作映射,元学习增强多系统适配
- 本地化推理减风险:在设备端执行视觉理解,减少截图上传的隐私泄露
🔄 分歧与讨论
分歧一:纯 GUI Agent vs 混合动作——两条技术路线的选择
- 纯 GUI 路线(OpenAI Operator、Claude CUA):坚持”像人一样操作”,通用性强,但执行链长、易出错
- 混合动作路线(UltraCUA):GUI + 程序化调用,效率高、错误少,但需先发现/收集工具
我的判断:混合动作路线是必然方向。纯 GUI 是起点,但长期来看,任何重复高频的 GUI 操作最终都会被封装为程序化调用。这就像人类用户也会给常用操作设快捷键——AI Agent 也应该这样做。UltraCUA 的 881 个工具收集流水线,本质上是在做”Agent 的快捷键发现”。
分歧二:GUI Agent 真的能取代 RPA 吗?
- 支持方:GUI Agent 有语义理解能力,不再依赖固定坐标,泛化远超 RPA
- 反对方:GUI Agent 成功率只有 38%(OSWorld),而 RPA 虽然笨但稳定可靠;企业级场景宁可笨但可靠,不要聪明但不可控
我的判断:短期不会取代,长期会融合。RPA 的可靠性与 GUI Agent 的灵活性需要结合——先用 GUI Agent 探索路径,验证稳定后下沉为 RPA 式的确定性脚本。这不是”取代”的故事,而是”GUI Agent 发现路径 → 自动生成 RPA 脚本”的闭环。
🔗 与已学内容的联系
| 已学主题 | 与 Computer Use Agent 的联系 |
|---|---|
| 8-03 Tool Use | GUI Agent 本质是用”GUI”作为工具——一种非结构化的工具调用方式 |
| 8-11 Coding Agent | Coding Agent = CLI 路径的代表,GUI Agent = 视觉路径的代表,两者互补 |
| 7-24 记忆 | GUI Agent 的短期记忆(当前操作状态)+ 长期记忆(历史轨迹 RAG) |
| 7-29 Multi-Agent | Genspark 的 MoA 架构(9+ 模型混合)、OWL 的多代理协作 |
| 8-17/8-18 Harness | GUI Agent 的沙盒隔离(Manus 的 Linux 沙箱)是 Harness E 层的实例 |
| 8-05 安全 | GUI Agent 面临最严峻的隐私安全挑战——截图含敏感信息 |
| 8-07 HITL | CUA 遇敏感操作主动寻求用户确认——GUI Agent 的 HITL 天然断点更多 |
| 8-06 MCP | UltraCUA 的程序化工具调用与 MCP 协议的互补关系 |
| 7-27 Skill | 高频 GUI 操作封装为 Skill 后向 CLI 迁移——分层策略的中层 |
| 8-04 Planning | CUA 的 CoT 推理本质是 Planning——看屏幕→规划→执行→观察 |
| 8-13 产品设计 | GUI Agent 的 UX 设计(实时显示执行步骤、信任透传) |
| 8-19 Deep Research | GUI Agent 作为”浏览器自动化”工具是 DR Agent 的核心组件之一 |
📌 一句话收口:8-03 Tool Use 是”Agent 会用工具”,8-11 Coding Agent 是”Agent 会写代码”,而 Computer Use Agent 是”Agent 会操作电脑”——这是从”接口世界”到”视觉世界”的跨越,也是 Agent 真正走入每个人工作流的最后一公里。
🤔 思考题
- 安全架构设计题:如果你要设计一个 GUI Agent 的安全架构,如何确保截图中的密码、商业数据不被泄露?本地推理 vs 远程推理 vs 可信执行环境(TEE),各有什么权衡?
- 混合动作决策题:UltraCUA 的混合动作让 Agent 自主选择”走 GUI 还是走 API”。如果 Agent 选错了路径(比如该用 API 时却点了 GUI 按钮,效率极低),你如何设计反馈机制让它下次选对?
- 分层迁移实操题:你的公司有 50 个日常业务流程,其中 30 个有 API、20 个只能用 GUI 操作。你会如何设计迁移策略?哪些先做 CLI 自动化?哪些用 GUI Agent 先跑起来?哪些保持人工?
- 未来预测题:如果 2027 年 GUI Agent 的成功率从 38% 提升到 80%(接近人类水平),RPA 行业会怎样? 传统的 RPA 公司(UiPath 等)是转型还是消亡?
🛠️ 行动项
- 用 Playwright 构建一个最小 Web GUI Agent 原型:实现”截图→LLM 推理→执行操作”的闭环,对任意网页完成一个简单任务(如搜索并点击某个链接),记录成功率。
- 对比 CLI vs GUI 路径的效率差异:同一个任务(如”在 GitHub 上创建一个 repo”),分别用 GitHub API(CLI 路径)和 Playwright 浏览器自动化(GUI 路径)实现,对比代码量、执行时间、错误率。
📚 参考文章
- GUI Agent 综述:从传统自动化到多模态大模型驱动的智能体 — 全面综述视角:三代演进路径、五组件架构、提示工程、记忆机制、四大挑战与三大方向
- 7 大计算机使用代理(CUA) — 产品总览视角:7 个代表性 CUA 的核心差异与能力对比
- Operator 背后的技术:Computer-Using Agent(CUA) — OpenAI 深度拆解:CUA 三步工作流、性能基准、OpenAI 五级发展路线图
- UltraCUA:A Foundation Model for Computer Use Agents with Hybrid Action — 学术创新视角:混合动作机制、881 工具自动收集、17K+ 合成数据、SFT+RL 两阶段训练、OSWorld 41.0% 登顶
- AI Agent 交互形态演进:图形界面与命令行 — 范式比较视角:CLI 三大优势、GUI 四大不可替代场景、企业选型四维度、分层迁移策略
📅 2026-08-20 | 第 19 篇每日学习笔记
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!













