看了下似乎就是操作虚拟环境的浏览器
https://ai.google.dev/gemini-api/docs/computer-use#implement-computer-use
刚刚,谷歌发布用于计算机使用(Computer Use)的新模型:Gemini 2.5 Computer Use,它是基于 Gemini 2.5 Pro 的视觉理解与推理能力构建的全新专用模型,能够驱动可以与用户界面交互的智能体。虽然是预览版,Gemini 2.5 Computer Use 模型在多个网页与移动端控制基准测试中表现优于同类领先方案,并且具备更低延迟。
虽然 AI 模型通常可以通过结构化 API 与软件交互,但许多数字化任务仍然需要直接操作图形用户界面(GUI),例如填写并提交表单。要完成这类任务,智能体必须像人类一样浏览网页和应用程序:通过点击、输入、滚动等方式。具备原生填写表单、操作下拉菜单与筛选器、以及在登录界面后进行操作的能力,是构建强大通用智能体的重要下一步。而这就需要Computer Use模型,Computer Use 模型借助截图,可以“看见”计算机屏幕,并通过生成特定的 UI 操作(如鼠标点击、键盘输入等)来“执行”动作。与函数调用类似,开发者需要编写客户端应用程序代码,用于接收并执行这些Computer Use 操作。使用 Computer Use 功能,你可以构建能够完成以下任务的智能体:
在网站上自动执行重复性的数据录入或表单填写;
对网页应用和用户操作流程进行自动化测试;
在各类网站上开展研究(例如,从电商网站收集产品信息、价格和评论,用于辅助购买决策)。
工作原理
Gemini 2.5 Computer Use 模型的核心功能通过 Gemini API 中全新的 computer_use 工具对外提供,并应在循环中运行。该工具的输入包括:用户请求、当前环境的截图,以及最近的操作历史。此外,输入还可以指定是否从完整的支持操作列表中排除某些功能,或额外包含自定义功能。
模型会分析这些输入并生成响应,通常是一个表示某种 UI 操作(例如点击或输入)的函数调用。该响应中也可能包含一个用户确认请求,这在执行某些操作(例如进行购买)时是必须的。随后,客户端代码会执行收到的操作。操作执行后,系统会将新的 GUI 截图和当前 URL 作为函数响应发送回 Computer Use 模型,从而重新启动循环。这个迭代过程会持续进行,直到任务完成、出现错误,或因安全机制或用户决策而终止交互。
厉害