- 一个 专门用于“电脑操作 / 界面操作(Computer Use)” 的模型,基于 Gemini 2.5 Pro 的视觉理解和推理能力构建。
- 通过 Gemini API 向开发者开放,用于构建“代理”(agent),这些代理可以直接与用户界面(UI)交互 —— 比如点击、输入、滚动等操作。
- 既支持网页浏览器操作,也在移动界面上表现有潜力,但目前还没优化用于桌面操作系统层面的控制。
工作机制 / 设计方式:
- 模型通过一个新的 computer_use 工具暴露给 API 客户端:给它用户请求 + 当前界面截图 + 操作历史,它输出一个动作(如点击 / 输入)或请求用户确认的指令。
- 客户端收到动作后,在真实界面上执行(例如在浏览器里点某个按钮、填表单等),然后将新的截图和界面状态反馈给模型,进入下一轮循环,直到完成任务或遇到错误或安全终止。
- 在设计中,允许开发者对“高风险动作”(如购买、系统改动等)设定必须 “用户确认” 或 “拒绝” 策略,从而增强安全性。
- 在每一步还会有一个 安全服务(per-step safety service)对模型提议的动作做评估,防止模型执行有害或越界操作。
性能、用途与安全考虑
- 在几个主流基准测试(web / mobile 控制任务等)中,Gemini 2.5 Computer Use 在准确性与低延迟之间取得了比较好的平衡,据称优于现有竞争模型。
- 目前已被 Google 内部用于 UI 测试、以及在一些产品如 AI 模式里的代理能力等场景中。
- 安全方面,Google 在模型内部就加入了风险控制机制,并提供给开发者安全控制选项,限制模型执行某些敏感或危险操作。
- 目前该模型处于公开预览(public preview)阶段,开发者可以通过 Gemini API, AI Studio 或 Vertex AI 访问。