DeepFloodbeta

谷歌发布 Gemini 2.5 Computer Use 模型 主要针对浏览器操作

https://blog.google/technology/google-deepmind/gemini-computer-use-model/

谷歌推出 Gemini 2.5 Computer Use,一款能够在浏览器中自主浏览网页、解析视觉信息并与页面交互的 AI 模型。

翻译AI总结如下

产品发布

  • Google 正式推出 Gemini 2.5 Computer Use 模型,这是在 Gemini 2.5 Pro 基础上专门为 UI(网页、移动端)交互打造的模型。
  • 通过 Gemini API(Google AI Studio、Vertex AI)提供 公共预览,开发者可直接调用 computer_use 工具。

核心能力

  • 能像人类一样 点击、输入、滚动、拖拽 等操作 UI 元素,完成表单填写、登录、下单等需要图形界面的任务。
  • 工作方式为 循环交互:用户请求 + 当前截图/URL → 模型生成函数调用 → 客户端执行动作 → 返回新截图 → 继续循环,直至任务完成或安全中止。
  • 主要面向 网页浏览器,在移动端 UI 控制上也有良好表现,尚未针对桌面 OS 级别控制进行优化。

性能表现

  • Online‑Mind2Web、WebVoyager、AndroidWorld 等公开基准上领先,准确率 70%+,平均延迟约 225 秒,在同类产品中实现最低延迟‑最高准确率的组合。
  • 与行业竞争对手相比,执行速度提升约 50%,复杂场景下的成功率提升 18%,对 UI 测试的失败恢复率提升至 60%

安全机制

  • 模型内部已嵌入安全特征,针对 误操作、提示注入、网络诈骗 等风险进行防护(详见 Gemini 2.5 Computer Use System Card)。
  • 开发者可使用两层安全控制:
    1. Per‑step safety service:在模型提出每一步动作前进行推理时安全评估。
    2. System instructions:可定义高风险动作必须拒绝或征求用户确认(如绕过 CAPTCHA、控制医疗设备等)。
  • 官方强烈建议在正式上线前进行充分的测试。

早期使用案例

  • Google 内部已用于 UI 自动化测试,显著缩短开发调试时间。
  • 第三方项目如 Project Mariner、Firebase Testing Agent、AI Mode in Search 已在部分功能中集成该模型。
  • 客户反馈示例:
    • Poke.com:在 iMessage、WhatsApp 等多渠道的 AI 助手中,速度快 50%,效果优于竞争方案。
    • Autotab:在高难度评估上提升 18% 的可靠性。
    • Google Payments 团队:使用该模型作为容错机制,降低 UI 测试失败率 25%,恢复率超过 60%。

如何开始

  1. 访问预览:在 Google AI Studio 或 Vertex AI 中启用 Gemini 2.5 Computer Use。
  2. 体验 Demo:可在 Browserbase 提供的演示环境中以 3× 速观看实际操控案例。
  3. 快速上手:参考官方资料文档 (参见企业使用的 Vertex AI 文档),使用 Playwright 或在 Browserbase 云 VM 中搭建本地 agent 循环。
  4. 加入社区:在 Developer Forum 分享使用经验、反馈需求,帮助塑造后续路线图。

简而言之,Gemini 2.5 Computer Use 是 Google 为让 AI 能在浏览器里“像人一样”操作网页而推出的专用模型,具备强大的网页/移动 UI 操作能力、领先的性能和多层安全防护,现已向开发者开放预览,并已有多家内部外部团队取得显著成效。

  • 成本应该不低