Agent(智能体)是最近一段时间的人工智能热点之一,将大语言模型的能力与工具调用、环境交互和自主规划结合起来,使其能够像虚拟助理一样完成复杂任务。

其中「计算机使用智能体」(computer-use agent,CUA)是一种能够直接在电脑环境中代替人类执行操作的智能体。它和传统的对话式AI不同,不只是回答问题,而是模拟人类使用鼠标、键盘和操作软件来完成任务。在该领域,Simular Research 推出的框架Agent S 是典型代表之一。

Agent S3 还首次引入了并行扩展的CUA 框架 -- Behavior Best-of-N(bBoN),它不再依赖单次智能体运行,而是从多次rollout(执行过程)中挑选最佳结
果。这种方法解锁了可扩展的性能提升,使准确率从62.6%提高到69.9%,并展示了智能体框架如何仅凭借扩展多样化运行次数,就能获得持续改进。