← LeisureLinux 文章索引
LeisureLinux · 微信公众号文章

Gemini 3.5 Flash 的「计算机使用」能力来了——你的 AI 现在能操作电脑了

AI/Agent 阅读原文(微信)↗

读完本文,你会搞懂 Google 新发布的 Computer Use 能力到底是什么、怎么用、为什么值得关注。

━━━ ━━━ ━━━

一句话

2026 年 6 月 24 日,Google 在 Gemini 3.5 Flash 中正式内置了 Computer Use(计算机使用) 能力。从此,AI 模型不再只是「聊天框里回答问题」,它能 看屏幕、点按钮、打字、滑动页面,像真人一样操作你的电脑。

背景:从「对话助手」到「行动代理」

如果把 2023-2025 年的 AI 比作「图书馆管理员」——你问什么它答什么,那么 2026 年的 AI 正在变成「实习生」——它能理解你的目标,然后自己去操作软件完成。

Google 在 5 月的 I/O 2026 上发布了 Gemini 3.5 Flash,核心定位是 \"Frontier Intelligence with Action\"——前沿智慧 + 行动能力。其中最重要的新能力就是 Computer Use。

在此之前,Computer Use 只是一个独立的实验模型(Gemini 2.5 Computer Use Model),需要单独调用。现在,它被原生集成到 Gemini 3.5 Flash 主力模型中,开发者通过 Gemini API 就能直接调用,不需要额外配置。

什么是 Computer Use?

通俗地说:Computer Use 让 AI 能像人一样操作图形界面。

具体能力:

  • 看: AI 能「看到」屏幕上的内容(浏览器、桌面、移动端应用)
  • 想: 它理解当前界面,判断下一步该做什么
  • 动: 它可以直接点击、输入文字、滚动页面、拖拽元素

这些听起来简单,但背后是两个巨大的技术突破:

  1. 视觉理解 + 操作闭环:模型不仅要看懂像素,还要知道哪个按钮对应什么操作
  2. 多步骤任务规划:不是一次点击,而是几百次操作的连贯执行

怎么用?方式一:Gemini API(开发者)

# 伪代码示例

from google.genai import types

# 创建一个带有 Computer Use 能力的智能体
agent = client.aip_agents.create(

model="gemini-3.5-flash",

tools=[types.Tool.computer_use()]
)

# 给它一个任务
agent.run("打开浏览器,登录 CRM 系统,导出今天的新客户名单")

开发者可以控制:

  • 操作的敏感度——哪些操作需要人工确认
  • 运行的环境——浏览器、桌面应用、移动设备
  • 安全策略——检测可疑指令时自动暂停

参考文档:

  • Gemini API 文档:https://ai.google.dev/gemini-api/docs/computer-use
  • GitHub 参考实现:https://github.com/google-gemini/computer-use-preview

方式二:Gemini Enterprise Agent Platform(企业)

企业用户可以通过 Agent Platform 搭建多智能体工作流,每个智能体可以配备 Computer Use 能力。

方式三:体验 Demo

直接体验 Computer Use 的效果(无需开发):

https://gemini.browserbase.com/

它能做什么?🏢 企业自动化

  • 长期任务执行:原来要人工操作几小时的流程(跨系统数据迁移、多步审批),AI 代理能自动跑完
  • 跨平台操作:同一个代理可以同时操作 Web 应用、桌面软件和移动端

🧪 软件测试

  • 自动化回归测试:AI 直接操作 UI,发现 bug 后截图并写报告
  • 无障碍审核:AI 能模拟不同用户视角检查网页无障碍标准(Google 自己的产品已经在用)

📊 知识工作

  • 数据录入与整理:从多个系统抓取数据、合并、生成报告
  • 文档审核:AI 能在操作过程中实时验证内容正确性

安全性设计

Computer Use 能力越强,风险也越大。Google 在这方面的设计值得关注:

① 对抗训练

针对提示注入(Prompt Injection)攻击做了专门的对抗训练。防止恶意网站通过页面上的隐藏文字诱导 AI 执行危险操作。

② 两重防护

可选的企业级安全防护:

  • 敏感操作确认:删除文件、转账等不可逆操作,需要人工确认
  • 间接提示注入检测:AI 在浏览网页时,如果检测到可疑指令,会自动停止

③ 纵深防御建议

Google 建议开发者结合使用:

  • 🔒 安全沙箱(隔离运行环境)
  • 👤 人工参与验证(Human-in-the-loop)
  • 🚫 严格访问控制(最小权限原则)

安全最佳实践详见:https://ai.google.dev/gemini-api/docs/computer-use#safety-best-practices

真实案例Shopify——多代理并行分析

Shopify 利用 Gemini 3.5 Flash 运行多个代理并行分析长期数据,从复杂数据集中提取趋势,实现更准确的商家增长预测。Computer Use 让这些代理能直接操作 Shopify 的商家后台界面。

Macquarie Bank——文档自动化

Macquarie Bank 使用 Gemini 3.5 Flash 自动解析 100 多页的复杂文档,大幅加速了开户流程。Computer Use 能力让 AI 能实际操作银行系统界面完成文档录入。

Salesforce——Agentforce 集成

Salesforce 将 Gemini 3.5 Flash 集成到其 Agentforce 平台,让 AI 代理不仅能对话,还能直接操作 Salesforce CRM 界面

Ramp——智能发票识别

Ramp 利用多模态 OCR 能力智能识别发票,Computer Use 让 AI 能自动处理发票上传、分类和审核流程。

Xero——税务工作流自动化

Xero 使用 Gemini 3.5 Flash 实现了数周的税务工作流自动化,AI 代理直接操作会计软件完成计算和申报。

为什么它重要?对开发者

以前自动化需要 API 对接——先有 API 才能集成。Computer Use 打破了这一限制。没有 API 的传统软件,也能被 AI 操作。这意味着:

  • 老旧系统的自动化成本大幅降低
  • 跨系统集成的门槛显著下降
  • 测试效率数量级提升

对企业

Computer Use 让「RPA(机器人流程自动化)」进入 AI 原生时代。传统 RPA 需要人工录制操作步骤,脆弱且难维护。AI 代理则能理解目标、自主规划、动态适应界面变化

对整个行业

这是 AI 从「回答者」到「行动者」的关键转折。当 AI 能操作电脑,它就不再只是工具——它变成了你的数字同事

局限性

当然,Computer Use 还远非完美:

  • 速度:AI 「看屏幕 → 思考 → 操作」的循环比真人慢
  • 可靠性:复杂、多步骤任务仍可能出错
  • 环境要求:需要稳定的图形界面输出

参考文献

  1. Google DeepMind Blog. *Introducing computer use in Gemini 3.5 Flash*. 2026-06-24. https://blog.google/innovation-and-ai/models-and-research/gemini-models/introducing-computer-use-gemini-3-5-flash/
  2. Google AI for Developers. *Computer Use with Gemini API*. https://ai.google.dev/gemini-api/docs/computer-use
  3. Google Gemini Enterprise Agent Platform. https://console.cloud.google.com/agent-platform
  4. Gemini Computer Use Preview (GitHub). https://github.com/google-gemini/computer-use-preview
  5. Browserbase Demo. *Try Computer Use*. https://gemini.browserbase.com/
  6. Google I/O 2026. *Gemini 3.5 Flash announcement*. 2026-05.
  7. TNW. *Google\'s Gemini 3.5 Flash gets Computer Use*. 2026-06-24.
  8. PureAI. *Gemini 3.5 Flash Computer Use launched*. https://pureai.com
  9. Google DeepMind. *Gemini 3.5 Flash model card*. https://deepmind.google
  10. Google Safety Best Practices. *Computer Use Safety*. https://ai.google.dev/gemini-api/docs/computer-use#safety-best-practices

━━━ ━━━ ━━━

后记: 写这篇文章的时候,我一直在想一个问题:如果 2026 年的 AI 已经能操作电脑了,那 2027 年的 AI 能做什么?或许是时候认真想想,「人机协作」这件事在未来 2-3 年会变成什么样。

炸了!Gemini 2.5 Pro Computer Use——告别 Selenium 时代,浏览器自动化的"视觉大脑"架构实践

Lightpanda——比 Chrome 快 60 倍、专为 AI Agent 设计的超轻量无头浏览器

自主 AI Agent 的系统级革命:深入拆解 OpenClaw 架构与执行逻辑

浏览器架构的次元突破:WebMCP 协议如何让 AI 真正"接管" Linux 运维?

Anthropic 官方揭秘:为什么一个简单的 Bash 工具,能横扫复杂的 AI 架构?

深度解析:Sam Altman 预言的 2026 技术拐点

本文整理自微信公众号 LeisureLinux 的原创内容(Linux / AI / 安全 硬核技术)。

· 阅读原文(微信公众号)

· 关注公众号 LeisureLinux,第一时间获取技术深度内容。

LeisureLinux 公众号二维码(微信扫一扫关注)