读完本文,你会搞懂 Google 新发布的 Computer Use 能力到底是什么、怎么用、为什么值得关注。
━━━ ━━━ ━━━
一句话
2026 年 6 月 24 日,Google 在 Gemini 3.5 Flash 中正式内置了 Computer Use(计算机使用) 能力。从此,AI 模型不再只是「聊天框里回答问题」,它能 看屏幕、点按钮、打字、滑动页面,像真人一样操作你的电脑。
背景:从「对话助手」到「行动代理」
如果把 2023-2025 年的 AI 比作「图书馆管理员」——你问什么它答什么,那么 2026 年的 AI 正在变成「实习生」——它能理解你的目标,然后自己去操作软件完成。
Google 在 5 月的 I/O 2026 上发布了 Gemini 3.5 Flash,核心定位是 \"Frontier Intelligence with Action\"——前沿智慧 + 行动能力。其中最重要的新能力就是 Computer Use。
在此之前,Computer Use 只是一个独立的实验模型(Gemini 2.5 Computer Use Model),需要单独调用。现在,它被原生集成到 Gemini 3.5 Flash 主力模型中,开发者通过 Gemini API 就能直接调用,不需要额外配置。
什么是 Computer Use?
通俗地说:Computer Use 让 AI 能像人一样操作图形界面。
具体能力:
- 看: AI 能「看到」屏幕上的内容(浏览器、桌面、移动端应用)
- 想: 它理解当前界面,判断下一步该做什么
- 动: 它可以直接点击、输入文字、滚动页面、拖拽元素
这些听起来简单,但背后是两个巨大的技术突破:
- 视觉理解 + 操作闭环:模型不仅要看懂像素,还要知道哪个按钮对应什么操作
- 多步骤任务规划:不是一次点击,而是几百次操作的连贯执行
怎么用?方式一:Gemini API(开发者)
# 伪代码示例
from google.genai import types
# 创建一个带有 Computer Use 能力的智能体
agent = client.aip_agents.create(
model="gemini-3.5-flash",
tools=[types.Tool.computer_use()]
)
# 给它一个任务
agent.run("打开浏览器,登录 CRM 系统,导出今天的新客户名单")
开发者可以控制:
- 操作的敏感度——哪些操作需要人工确认
- 运行的环境——浏览器、桌面应用、移动设备
- 安全策略——检测可疑指令时自动暂停
参考文档:
- Gemini API 文档:https://ai.google.dev/gemini-api/docs/computer-use
- GitHub 参考实现:https://github.com/google-gemini/computer-use-preview
方式二:Gemini Enterprise Agent Platform(企业)
企业用户可以通过 Agent Platform 搭建多智能体工作流,每个智能体可以配备 Computer Use 能力。
方式三:体验 Demo
直接体验 Computer Use 的效果(无需开发):
https://gemini.browserbase.com/
它能做什么?🏢 企业自动化
- 长期任务执行:原来要人工操作几小时的流程(跨系统数据迁移、多步审批),AI 代理能自动跑完
- 跨平台操作:同一个代理可以同时操作 Web 应用、桌面软件和移动端
🧪 软件测试
- 自动化回归测试:AI 直接操作 UI,发现 bug 后截图并写报告
- 无障碍审核:AI 能模拟不同用户视角检查网页无障碍标准(Google 自己的产品已经在用)
📊 知识工作
- 数据录入与整理:从多个系统抓取数据、合并、生成报告
- 文档审核:AI 能在操作过程中实时验证内容正确性
安全性设计
Computer Use 能力越强,风险也越大。Google 在这方面的设计值得关注:
① 对抗训练
针对提示注入(Prompt Injection)攻击做了专门的对抗训练。防止恶意网站通过页面上的隐藏文字诱导 AI 执行危险操作。
② 两重防护
可选的企业级安全防护:
- 敏感操作确认:删除文件、转账等不可逆操作,需要人工确认
- 间接提示注入检测:AI 在浏览网页时,如果检测到可疑指令,会自动停止
③ 纵深防御建议
Google 建议开发者结合使用:
- 🔒 安全沙箱(隔离运行环境)
- 👤 人工参与验证(Human-in-the-loop)
- 🚫 严格访问控制(最小权限原则)
安全最佳实践详见:https://ai.google.dev/gemini-api/docs/computer-use#safety-best-practices
真实案例Shopify——多代理并行分析
Shopify 利用 Gemini 3.5 Flash 运行多个代理并行分析长期数据,从复杂数据集中提取趋势,实现更准确的商家增长预测。Computer Use 让这些代理能直接操作 Shopify 的商家后台界面。
Macquarie Bank——文档自动化
Macquarie Bank 使用 Gemini 3.5 Flash 自动解析 100 多页的复杂文档,大幅加速了开户流程。Computer Use 能力让 AI 能实际操作银行系统界面完成文档录入。
Salesforce——Agentforce 集成
Salesforce 将 Gemini 3.5 Flash 集成到其 Agentforce 平台,让 AI 代理不仅能对话,还能直接操作 Salesforce CRM 界面。
Ramp——智能发票识别
Ramp 利用多模态 OCR 能力智能识别发票,Computer Use 让 AI 能自动处理发票上传、分类和审核流程。
Xero——税务工作流自动化
Xero 使用 Gemini 3.5 Flash 实现了数周的税务工作流自动化,AI 代理直接操作会计软件完成计算和申报。
为什么它重要?对开发者
以前自动化需要 API 对接——先有 API 才能集成。Computer Use 打破了这一限制。没有 API 的传统软件,也能被 AI 操作。这意味着:
- 老旧系统的自动化成本大幅降低
- 跨系统集成的门槛显著下降
- 测试效率数量级提升
对企业
Computer Use 让「RPA(机器人流程自动化)」进入 AI 原生时代。传统 RPA 需要人工录制操作步骤,脆弱且难维护。AI 代理则能理解目标、自主规划、动态适应界面变化。
对整个行业
这是 AI 从「回答者」到「行动者」的关键转折。当 AI 能操作电脑,它就不再只是工具——它变成了你的数字同事。
局限性
当然,Computer Use 还远非完美:
- 速度:AI 「看屏幕 → 思考 → 操作」的循环比真人慢
- 可靠性:复杂、多步骤任务仍可能出错
- 环境要求:需要稳定的图形界面输出
参考文献
- Google DeepMind Blog. *Introducing computer use in Gemini 3.5 Flash*. 2026-06-24. https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-computer-use-gemini-3-5-flash/
- Google AI for Developers. *Computer Use with Gemini API*. https://ai.google.dev/gemini-api/docs/computer-use
- Google Gemini Enterprise Agent Platform. https://console.cloud.google.com/agent-platform
- Gemini Computer Use Preview (GitHub). https://github.com/google-gemini/computer-use-preview
- Browserbase Demo. *Try Computer Use*. https://gemini.browserbase.com/
- Google I/O 2026. *Gemini 3.5 Flash announcement*. 2026-05.
- TNW. *Google\'s Gemini 3.5 Flash gets Computer Use*. 2026-06-24.
- PureAI. *Gemini 3.5 Flash Computer Use launched*. https://pureai.com
- Google DeepMind. *Gemini 3.5 Flash model card*. https://deepmind.google
- Google Safety Best Practices. *Computer Use Safety*. https://ai.google.dev/gemini-api/docs/computer-use#safety-best-practices
━━━ ━━━ ━━━
后记: 写这篇文章的时候,我一直在想一个问题:如果 2026 年的 AI 已经能操作电脑了,那 2027 年的 AI 能做什么?或许是时候认真想想,「人机协作」这件事在未来 2-3 年会变成什么样。
炸了!Gemini 2.5 Pro Computer Use——告别 Selenium 时代,浏览器自动化的"视觉大脑"架构实践
Lightpanda——比 Chrome 快 60 倍、专为 AI Agent 设计的超轻量无头浏览器
自主 AI Agent 的系统级革命:深入拆解 OpenClaw 架构与执行逻辑
浏览器架构的次元突破:WebMCP 协议如何让 AI 真正"接管" Linux 运维?