Simular 的 Sai 计算机代理在 OSWorld 2.0 基准中达 73% 成功率,可执行操作系统日常操作,标志着 AI agent 在复杂环境中的实用性持续提升。
We’re so glad you’re here. You can expect all the best TNS content to arrive Monday through Friday to keep you on top of the news and at the top of your game.
Check your inbox for a confirmation email where you can adjust your preferences and even join additional groups.
Follow TNS on your favorite social media networks.
Become a TNS follower on LinkedIn.
Check out the latest featured and trending stories while you wait for your first TNS newsletter.
Sai,一款由 Simular 构建的计算机 agent,在 OSWorld 2.0 基准测试中取得了 73% 的成功率。该基准测试更新于周四发布,评分基于 108 项任务的基准测试,评估的是那些通常需要熟练人类花费超过 1 小时才能完成的漫长日常专业任务。
Simular 表示,这一 SOTA 表现"使 Sai 领先于"GPT-5.6 Sol(OpenAI 报告为 62.57%)和 Opus 5(Anthropic 报告为 70.57%),同时"Sai 以约等于两者三分之一的成本登顶"。
Sai 专为聚焦真实职场任务和功能而设计,而非为追求行业荣誉的无限制吞吐量而构建,它运行在完整的桌面应用程序和网页上,调用 API,并编写代码。
这款 agent 结合了前沿模型和专家模型,通过专用接口感知并操作用户的计算机,以公司承诺的"个人和企业均可承受的成本"执行复杂的现实世界任务。
Simular 联合创始人兼 CTO Jiachen Yang 告诉 The New Stack,他认为为每个人的日常(但必要)工作——如招聘外联、验证发票、研究最新资讯——构建的计算机 agent,"不应该让你掏空钱包",仅仅因为"底层模型为了解决世界上未解决的大型开放数学猜想"而训练,或者为展示原始工程能力而进行的某种追求。
"后人会觉得荒谬的是,人们现在仍在以这种方式构建模型,"Yang 说道。"Sai 在 OSWorld 2.0 上最优的成本-收益权衡,是迈向未来的一步——在那个未来里,我们不需要为完成工作支付高昂的价格。"
"后人会觉得荒谬的是,人们现在仍在以这种方式构建模型。Sai 在 OSWorld 2.0 上最优的成本-收益权衡,是迈向未来的一步——在那个未来里,我们不需要为完成工作支付高昂的价格。"
Simular 于今年 3 月首次发布 Sai。这家总部位于帕洛阿尔托的公司自称是"专注于研究的 agentic 初创公司",由前 DeepMind 科学家李昂(CEO)和 CTO Yang 创立。
该公司采用神经符号方法,即神经网络灵活的探索能力与符号代码的精确性的结合;这意味着解决的任务可以被编码(比喻地和字面意义上)成可重用的代码,每次以相同方式回放。这里的底线很简单:处理第一百张发票的成本不会像处理第一张那么高。
OSWorld 2.0 于 6 月 26 日启动(随后于 8 月 8 日更新),由香港大学 NLP 组的可执行语言落地(XLANG)实验室推出。据称,OSWorld 2.0 已经超越了评估初代中简短简单桌面测试的阶段。Simular 提醒我们,其开源 Agent S 是去年 12 月首个超越 OSWorld 1.0 人类基线的 agent。

当被问及为何 Sai 的结果尚未在 OSWorld 2.0 官方网站上显示(而它们曾在 OSWorld 1.0 上显示),Simular 表示,"公司和组织先在自家网站上发布基准测试结果并不罕见(参见 Anthropic 和 OpenAI)。我们正在向 OSWorld 2.0 排行榜提交,同时也在将我们的轨迹上传到 Hugging Face。"
与 OSWorld 1.0 基准测试不同,OSWorld 2.0 任务以小时而非分钟计量。它们提出现实生活挑战,例如跨多个数据源查找和推理(如散布在邮件和费用报告中的收据)、响应动态环境变化(如任务执行过程中收到消息)、精确遵循教程(如报销指南)以及排查信息差异问题(如矛盾的数据)。
Simular 团队认为,它目前是行业内最稳健的开放基准测试,也是最能反映现实世界任务的基准测试。
Yang 和团队解释说,Sai 通过上述神经符号规划实现了更好的收益-成本权衡。这意味着 Sai 平均使用约 1.5 倍更少的模型调用次数,同时每轮执行更多操作,使用 Simulang 代码(macOS 上桌面自动化的 Claude Code 技能)作为符号语言来规划和执行更长的子任务。
为提高缓存和内存效率,Sai 通过自适应摘要(一种动态内存管理技术,保持模型的上下文窗口小)保持输入大小有界,并在摘要之前尽可能长时间地保持恒定的提示前缀。用代码规划使 Sai 能够在整个任务执行过程中在运行时内存中维护和访问关键任务信息。
对于模型编排,Sai 调用专家模型和接口来定位 UI 元素、执行纯推理和验证,从而避免在不需要完整任务上下文步骤中使用昂贵模型。
Sai、Sol 和 Opus 在 OSWorld 2.0 上接受测试时,被要求玩 Chrome Dino 游戏——一个重复的实时游戏,并在真实页面上达到分数目标。Sai 将一个重复的实时游戏视为编程问题而非点击问题。Sai 从原始像素测量地面线、障碍物速度和自身的输入延迟,然后编写了一个控制循环来捕获屏幕、检测障碍物并跳跃,在单个执行调用中在虚拟机上运行它。
agent 们还被要求执行 OSWorld 2.0 上的任务 28,这是一项名为疫苗预约的测试,涉及获取关于所需免疫接种的邮件、桌面上扫描的疫苗接种记录以及一个有价格、距离和日期约束的预约网站。
硬核机器学习计算机科学家 Santiago Valdarrama 似乎是一个粉丝;他在 LinkedIn 上写道,"因为 Sai 运行在完整桌面上,而不仅仅是浏览器或 API,它可以处理阻止标准自动化的应用程序。这为大多数 agent 无法触及的整类任务打开了大门。"
"因为 Sai 运行在完整桌面上,而不仅仅是浏览器或 API,它可以处理阻止标准自动化的应用程序。这为大多数 agent 无法触及的整类任务打开了大门。"
或许更为平衡的是(在同一讨论中回应 Valdarrama 最初标记的)AI 营收系统专家 Baljinder Lally,他指出 Sai 的到来"与我迄今为止构建 agent 工作流所见的相符"。但他警告说,"演示看起来很棒,但可靠性来自护栏、可见性和人在环检查点。"
AgenticMode AI 创始人 Jahanzaib A. 同样持平衡态度。他说,他在语音 agent 上遇到了相同的可靠性问题。"它们会在每个演示中都表现出色,然后在生产中在没人预测到的边缘情况下静默失败。可观测性部分就是一切——没有它,你就是在盲目调试,"他写道。
Simular 坚持其研究立足于经济有价值的工作而非演示。公司表示,这意味着它理解"计算机 agent 的整个技术栈",即模型、规划和落地、脚本层、agent 运行所在的虚拟机以及用户界面。
公司的底线是"Sai 是为每个人准备的,而不仅仅是实验室成果",这反映了一组新兴模型正被构建为专注于有形的、可交付的职场任务,而非某些计算、吞吐量和分析的全域直线加速赛中的参赛者。