Computer Use出来以后,AI不再只是会看,开始会动手了
没有接口的时候,AI 开始看界面、点按钮、把碎动作做完。
这是「搭系统实录」第三篇。
前一篇写 MCP,讲的是 AI 怎么通过统一协议调用系统能力。
这一篇写 Computer Use,讲的是另一条更贴近现场、也更容易被低估的路径:
当系统没有接口,AI 能不能直接看界面、点按钮、填表单、完成动作。
过去企业用 AI,主要还停在内容层。
写一段话,改一份材料,总结一篇会议纪要,查一堆资料。这些都很有用,但它们大多还没有真正碰到公司的业务系统。
Computer Use 出来以后,边界变了。
AI 不只是回答你,它开始能进入真实界面,沿着流程往下走。
这件事真正重要的地方,不是 AI 终于会“点鼠标”了,而是公司里大量原本只能靠人坐在电脑前完成的碎动作,第一次有了被重新设计的可能。
它不是一个更聪明的聊天框
Computer Use 的逻辑很直接:
先看屏幕截图,理解界面上有什么;再决定下一步动作;然后通过虚拟鼠标和键盘去点击、输入、滚动;执行完,再重新看屏幕,判断结果对不对。
OpenAI 在 2025 年 1 月发布 Operator,背后的模型叫 CUA,也就是 Computer-Using Agent。OpenAI 对它的描述很明确:模型可以看见浏览器界面,并通过点击、输入、滚动来完成任务。
Anthropic 更早在 2024 年 10 月开放了 Claude 的 computer use 能力,让模型通过截图观察桌面,再用虚拟键鼠操作软件。Anthropic 当时也提醒,这个能力还处在早期阶段,需要开发者在低风险任务里逐步试用。
到 2025 年 7 月,OpenAI 又发布 ChatGPT agent,把网页浏览、深度研究和计算机操作能力放进同一个 agent 模式里。
这些信号放在一起看,说明一件事:
AI 正在从“会调用工具”,走向“会操作环境”。
这不是产品名的变化,而是能力边界的变化。
接口能通,就走接口;接口不通,它开始尝试走界面。
它和 RPA 的差别,不在速度,在逻辑
一听到“AI 操作界面”,很多人会想到 RPA。
这个联想不奇怪,但如果只把 Computer Use 理解成新一代 RPA,很容易低估它。
传统 RPA 更像脚本。你提前定义好步骤,它按步骤跑。界面稳定、流程固定、规则清楚的时候,它很有效。
但 RPA 最怕变化。
按钮换了位置,弹窗多了一层,字段名改了一下,页面加载慢了一点,脚本就可能失败。
Computer Use 的起点不是坐标,而是目标。
它不是只记住“点第几个按钮”,而是先看当前界面,再判断哪里像提交按钮、哪里像输入框、下一步应该怎么走。
所以差别不是:
RPA 慢,Computer Use 快。
真正的差别是:
RPA 执行的是预设步骤,Computer Use 执行的是当前目标。
这句话很关键。
因为企业里有大量流程,并不是完全没有规则,而是规则写得不够干净,系统接口不够完整,界面还经常变。
过去这类流程很难自动化。
现在它们开始变成可讨论对象。
为什么这会打到企业流程
Gartner 在 2025 年 8 月有一个判断:到 2026 年底,40% 的企业应用会集成任务型 AI agents,而 2025 年这个比例还不到 5%。
这个数字不需要被神化,但它说明一个方向:
企业软件不会只把 AI 当成写作助手,它会越来越多地把 AI 放进任务执行链条里。
MCP 解决的是一类问题:系统愿意开放能力时,AI 怎么标准化调用。
Computer Use 解决的是另一类问题:系统还没有开放能力时,AI 能不能先从界面进入流程。
这两条路合在一起,企业 AI 才开始真正接近业务现场。
一条是接口层。
一条是界面层。
接口层更稳,适合长期工程化。
界面层更粗糙,但很可能先碰到那些“每天都有人在做、但一直没人愿意改”的重复动作。
公司里会先被改写的三类动作
不是所有流程都应该先交给 Computer Use。
最先适合试的,通常不是高判断、高风险、高金额的环节,而是三类低判断、高重复、跨系统的动作。
第一类,跨系统搬运。
一个人要从 A 系统查信息,再到 B 系统录入,再到 C 系统提交。真正的价值不在“判断”,而在“跑完”。这类动作最耗人,也最容易被忽略。
第二类,周期性核对。
周报、月报、客户信息同步、项目状态更新。每次都差不多,但每次都要打开几个系统、复制几段内容、核对几个字段。
第三类,流程后的补动作。
会议结束后补纪要,项目推进后改状态,沟通结束后补记录。很多管理动作最后不是输在判断,而是输在这些尾巴没人愿意收。
这些动作有一个共同点:
它们不一定值得单独开发系统接口,但长期让人手工做,又非常浪费。
Computer Use 的价值,恰好出现在这个缝里。
它不一定马上替代系统集成,但它会逼管理者重新看一遍:
公司里到底有多少工作,本质上只是人在替系统补接口。
真正要先画清楚的不是流程,而是边界
Computer Use 一旦进入公司,管理者最该紧张的不是“能不能自动化”。
而是三个更基础的问题。
第一,权限边界。
AI 能看哪些系统?能填哪些字段?能不能点提交?能不能发邮件?能不能改客户资料?能不能触发付款或审批?
这些不是技术细节,是管理授权。
第二,确认点。
哪些动作可以自动完成,哪些动作必须在人确认以后才能继续。尤其是涉及金额、外部承诺、员工信息、客户信息、权限变更的动作,不能因为技术能点,就默认可以点。
第三,审计链。
AI 看了什么,点了什么,改了什么,失败在哪里,为什么重试,谁最终确认。
如果这些追不回来,Computer Use 做得越多,组织反而越失控。
所以我对这件事的判断很简单:
Computer Use 降低的是自动化的技术门槛,不是管理门槛。
它越容易上手,越不能绕过权限、确认和追溯。
企业真正该怎么开始
不要一上来就问“能不能替代某个岗位”。
这个问题太大,也太容易把事情带偏。
更好的起点是找三条链路:
第一,找一个每天都有人反复登录、复制、粘贴、核对的流程。
第二,把里面的动作拆成两类:执行动作和判断动作。
第三,只让 AI 先试执行动作,把判断动作和高风险动作留给人。
这才是比较稳的试点方式。
不是为了证明 AI 很强,而是为了验证一件更重要的事:
在你的组织里,哪些动作已经可以从“人亲自点”变成“人授权、AI 执行、人复核”。
这个变化一旦成立,意义就不只是省一点时间。
它会改变公司对流程的理解。
过去流程设计默认执行者是人,所以很多接口、字段、确认点都写得很粗。
以后如果流程里会出现 AI 执行者,流程本身就必须写得更清楚。
谁能看,谁能动,动到哪一步停,失败以后怎么回滚。
这些都会从“上线以后再说”,提前变成流程设计的一部分。
最后
如果只把 Computer Use 看成“AI 会操作电脑”,它会显得像一个好玩的功能。
但如果放到企业里看,它更像一个信号:
AI 正在从内容生产,进入流程执行。
这一步不会一夜之间改变公司,也不会立刻替代所有人。
但它会把一个以前很模糊的问题推到管理者面前:
当 AI 也能动手,组织里的动作边界到底该怎么重新写。
下一篇 TC,我会继续拆另一条同样关键、但更容易被误读的技术线:
Deep Research 进公司后,真正改掉的可能不是搜索,而是那些一直很贵、但一直被低估的前置调研动作。

参考资料:
- OpenAI, Introducing Operator, 2025-01-23: https://openai.com/index/introducing-operator/
- OpenAI, Introducing ChatGPT agent, 2025-07-17: https://openai.com/index/introducing-chatgpt-agent/
- Anthropic, Claude 3.5 Sonnet and computer use, 2024-10-22: https://www.anthropic.com/news/3-5-models-and-computer-use
- Gartner, 40% of enterprise applications will be integrated with task-specific AI agents by 2026, 2025-08-26: https://www.gartner.com/en/newsroom/press-releases/2025-08-26-gartner-predicts-40-percent-of-enterprise-apps-will-feature-task-specific-ai-agents-by-2026-up-from-less-than-5-percent-in-2025
AI大同学 | 在职管理者,管理学博士,正在经历 AI 对管理与组织协作方式的重塑。这是「搭系统实录」系列第三篇。



