https://blog.google/technology/google-deepmind/gemini-computer-use-model/
谷歌推出 Gemini 2.5 Computer Use,一款能够在浏览器中自主浏览网页、解析视觉信息并与页面交互的 AI 模型。
翻译AI总结如下
产品发布
- Google 正式推出 Gemini 2.5 Computer Use 模型,这是在 Gemini 2.5 Pro 基础上专门为 UI(网页、移动端)交互打造的模型。
- 通过 Gemini API(Google AI Studio、Vertex AI)提供 公共预览,开发者可直接调用
computer_use工具。
核心能力
- 能像人类一样 点击、输入、滚动、拖拽 等操作 UI 元素,完成表单填写、登录、下单等需要图形界面的任务。
- 工作方式为 循环交互:用户请求 + 当前截图/URL → 模型生成函数调用 → 客户端执行动作 → 返回新截图 → 继续循环,直至任务完成或安全中止。
- 主要面向 网页浏览器,在移动端 UI 控制上也有良好表现,尚未针对桌面 OS 级别控制进行优化。
性能表现
- 在 Online‑Mind2Web、WebVoyager、AndroidWorld 等公开基准上领先,准确率 70%+,平均延迟约 225 秒,在同类产品中实现最低延迟‑最高准确率的组合。
- 与行业竞争对手相比,执行速度提升约 50%,复杂场景下的成功率提升 18%,对 UI 测试的失败恢复率提升至 60%。
安全机制
- 模型内部已嵌入安全特征,针对 误操作、提示注入、网络诈骗 等风险进行防护(详见 Gemini 2.5 Computer Use System Card)。
- 开发者可使用两层安全控制:
- Per‑step safety service:在模型提出每一步动作前进行推理时安全评估。
- System instructions:可定义高风险动作必须拒绝或征求用户确认(如绕过 CAPTCHA、控制医疗设备等)。
- 官方强烈建议在正式上线前进行充分的测试。
早期使用案例
- Google 内部已用于 UI 自动化测试,显著缩短开发调试时间。
- 第三方项目如 Project Mariner、Firebase Testing Agent、AI Mode in Search 已在部分功能中集成该模型。
- 客户反馈示例:
- Poke.com:在 iMessage、WhatsApp 等多渠道的 AI 助手中,速度快 50%,效果优于竞争方案。
- Autotab:在高难度评估上提升 18% 的可靠性。
- Google Payments 团队:使用该模型作为容错机制,降低 UI 测试失败率 25%,恢复率超过 60%。
如何开始
- 访问预览:在 Google AI Studio 或 Vertex AI 中启用 Gemini 2.5 Computer Use。
- 体验 Demo:可在 Browserbase 提供的演示环境中以 3× 速观看实际操控案例。
- 快速上手:参考官方资料和文档 (参见企业使用的 Vertex AI 文档),使用 Playwright 或在 Browserbase 云 VM 中搭建本地 agent 循环。
- 加入社区:在 Developer Forum 分享使用经验、反馈需求,帮助塑造后续路线图。
简而言之,Gemini 2.5 Computer Use 是 Google 为让 AI 能在浏览器里“像人一样”操作网页而推出的专用模型,具备强大的网页/移动 UI 操作能力、领先的性能和多层安全防护,现已向开发者开放预览,并已有多家内部外部团队取得显著成效。
成本应该不低