TrueFoundry发布开源Agent框架TrueForge,定位为Claude Managed Agents的开源替代品,提供AI基础设施平台的Agent harness能力。
AI 基础设施平台公司 TrueFoundry 发布了开源 Agent 框架 TrueForge。该技术被直接定位为 Claude Managed Agents 的替代品——后者是 Anthropic 提供的托管基础设施服务,用于运行、隔离和编排自主式的 Claude Agent。
TrueForge 承诺让软件工程师能够在任意模型(公司强调是真正的任意模型)或 MCP 服务器上构建、部署、调试和治理生产级 AI Agent,并将 Agent 的总运营成本降低约 50%。
虽然诸如中国前沿模型公司 Z.ai 的 GLM-5.2 等开源模型正在以更低成本挑战闭源前沿模型,但大多数托管 Agent 平台仍然将企业锁定在单一供应商的模型、基础设施和定价体系中。
挑战托管 Agent 平台锁定的普遍叙事
曾在 Meta 担任机器学习技术主管、现为 TrueFoundry 联合创始人兼 CEO 的 Nikunj Bajaj 告诉 The New Stack,这种普遍的托管 Agent 平台锁定现象正是他公司选择中立于模型供应商这一方法背后的逻辑。
“一家以每百万 Token 50 美元的价格向你出售服务的提供商,没有任何动机告诉你同样的任务可以用一个每百万 Token 仅收 50 美分的模型来完成,”Bajaj 说道。“传统上,一个供应商提供模型、构建你的 Agent,并决定你的 Token 使用量、使用顺序、使用哪些工具,以及在什么样的治理规则下——而托管 Agent 提供商把这些东西卖给你的竞争对手时,用的是完全相同的设置。”
从根本上说,他坚持认为,这意味着“激励机制是错位的”,因此在这个游戏中,“玩家们无法与裁判对话”——在托管 Agent 部署场景中,总是有权衡取舍。
“为什么要构建强大的 Agent 就意味着放弃对 AI 技术栈的控制权?我们给开发者托管 Agent 的体验,但不会强迫他们永远被困在某一个供应商里,”Bajaj 补充道。
“一家以每百万 Token 50 美元的价格向你出售服务的提供商,没有任何动机告诉你同样的任务可以用一个每百万 Token 仅收 50 美分的模型来完成。激励机制是错位的,所以在这个游戏中,玩家们无法与裁判对话。”
底层框架成为战略控制点
尽管 Claude Managed Agents 在今年四月才以 Beta 版本发布,Bajaj 和团队认为他们可以追踪一条正在被刻画出来的演进曲线。这条弧线看到第一波 AI Agent 存在于开发者的笔记本电脑上、内置于编码工具和原型中。但下一波正在进入面向客户的产品,其特点是具备使用共享工作流程能力的托管基础设施服务。
关键的是,这是一个转变,它将那些产品底层的框架变成了一个战略控制点,作为用户、模型及其交互系统之间运营循环中的执行层。
“这确实是现实:框架是用户、LLM 和其他一切之间的关键层,”Bajaj 澄清道。“假设一个开发者正在构建一个 Agent。他们带来了自己的模型,但框架仍然决定何时调用 MCP 服务器、何时使用别人已经构建好的 Agent、保留什么上下文,以及哪个模型处理计划的哪一部分。”
这意味着还有安全方面的影响。Bajaj 明确指出,“某些操作”仍然需要在完全隔离的沙箱中运行,有些数据永远不应该发送到闭源模型。
“所有这些逻辑都存在于框架中。如果软件工程师不使用框架,那么开发团队就必须从头开始构建所有这些逻辑,”他补充道。
企业会想要拥有关键的 Agent 层
在一种开放的、厂商中立的方式提供托管 Agent 平台的情况下,组织必须管理持久会话、工具凭证、执行沙箱、上下文、人工审批、调试、访问策略,以及跨每个运行的 Agent 的支出。TrueFoundry 赌的是企业会想要拥有这一层,而不是从单一模型提供商那里继承它,但要以更低的成本内置企业级治理。
TrueForge 通过 TrueFoundry 的 AI Gateway 路由每个模型调用和 MCP 交互,因此可以对预算执行、速率限制和防护栏进行应用,为企业提供治理良好且安全的托管 Agent 体验。
无头乱撞,当 foo 和 bar 在掌控方向盘时
当组织对方向盘没有同样的掌控权时,Bajaj 表示他亲眼目睹过一些操作场景,其中“foo”和“bar”(计算机编程中使用的标准占位符名称,用于尚未命名的已知元语法变量值,类似 John Doe)最终变成了所有事情的执行者。
“系统中每个操作都来自一个通用的共享账户,而不是一个你可以实际识别的人。所以当某些东西改变或坏了的时候,你不知道该找谁。有一次,当我们从共享访问迁移到个人访问的过程中,有一批密钥被轮换了。公司一半的人还在用旧账户,系统因此给公司一半的人带来了故障,”他解释道。
团队可以在自己的基础设施上运行 TrueForge,带来自己的模型、MCP 服务器和 API 密钥,并将每个任务路由到适合该作业成本、延迟或质量需求的模型。但这样做是否意味着工作负载会变得过于分散?
“恰恰相反,工作负载变得更加统一了,”Bajaj 热情地说。“大多数团队默认已经带来了自己的模型。改变的是,组织可以定义一个模型、Agent 或 MCP 需要满足什么条件才能进入他们的注册表。我称之为 Agent 开发生命周期,即 ADLC。一旦你拥有了这个,你就可以在所有事情上强制执行相同的操作原则。”
在实践中,TrueFoundry 团队确认,他们看到大多数以 AI 为中心的软件工程操作在典型任务上收敛到“大约十几个模型”,再加上一些用于专业工作的专门模型。
Anthropic 做错了什么吗?
TrueForge 附带了对 OpenAI、Anthropic 以及另外 20+ 模型的支持,还有 40+ 内置工具、沙箱化执行、人工审批工作流、大上下文处理、由 Tavily 提供支持的生成式 UI 和网络搜索。但尽管提供了 Claude Managed Agents 的替代品,Bajaj 仍然极力指出,他并没有把 Anthropic 描绘成某种反面角色。
“这不是说 Anthropic 做错了什么,”Bajaj 确认道。“而是它并不拥有世界上的每一个模型。Claude Managed Agents 只能从 Anthropic 提供的有限模型集中选择。有些开源模型在某些任务上表现出色,成本只是很小的一部分,或者对于特定工作来说能力更强。开放的框架有更广泛的选择。”
当你拥有框架时,你可以去掉那些不适合你的部分
他通过指出 Anthropic 也必须为非常广泛的客户群体构建一个框架来强调他的观点;这一事实意味着其系统提示词必须涵盖各种指令、防护栏和边缘情况。
“这些元素中的许多可能与开发者自己的用例完全无关,但它们仍然被放入每次调用中,增加成本和延迟。当你拥有框架时,你可以去掉那些不适合你的部分,让它变得极其专业化,”他补充道。
“需要明确的是,我们将 Anthropic 作为一等提供商来支持,因为它的模型很棒。在很多情况下我们的用户会想要使用它们。重点不是将选择限制在 Anthropic 一家。”
为了验证其声明,TrueFoundry 在 DevRev 公开的 Enterprise-Bench 的 14 个一级和二级任务上测试了上述说法。公司表示,TrueForge“以相似的准确度实现了 50% 的成本降低”,因此节省来自使用更少的 Token,以及使用 Anthropic 提供的模型之外更适合特定任务的模型。
“需要明确的是,我们将 Anthropic 作为一等提供商来支持,因为它的模型很棒。在很多情况下我们的用户会想要使用它们。重点不是将选择限制在 Anthropic 一家,”Bajaj 总结道。
TrueFoundry 还发布了 TrueForge 的托管按使用量付费版本,面向希望获得相同体验但不想自行管理基础设施的团队。