AWS 发布开源通用 AI Agent,号称比 Claude Code 和 Codex 便宜 45%,定位通用开发助手,将代码编写、测试、部署任务纳入同一 Agent 工作流。
Amazon Web Services(AWS)正式揭开了一款新型开源通用 AI Agent 的面纱——Strands Harness,旨在为开发者提供一个可本地运行或部署到云端的现成基础架构。
Strands Harness 构建于 Strands Agents 之上。Strands Agents 是 AWS 于 2025 年 5 月推出的开源 Python SDK,用于构建 AI Agent。Strands 采用了一种"模型驱动"的方法:由开发者提供模型、工具和指令,模型则自主决定如何处理任务以及何时调用这些工具。随后 AWS 将 Strands 移植到 TypeScript,并在 2025 年 2 月创建了 Strands Labs,作为更实验性项目的独立孵化基地。
AWS 副总裁兼杰出工程师 Marc Brooker 告诉 The New Stack,Strands Harness 本质上位于现有 Strands SDK 的上层,为开发者提供了一个预配置的 Strands Agent。它整合了 Agent 在长时间运行任务中所需的各种工具和支持机制,并由 AWS 提供这些组件如何协同工作的默认配置。
"你仍然需要决定如何管理上下文、持久化对话、集成工具,以及引导 Agent 的行为。"
Brooker 解释道:"像 Strands Harness SDK 这样的开发工具提供了基础模块,但开发者仍然需要自行决定如何管理上下文、持久化对话、集成工具,以及引导 Agent 的行为。"
开箱即用,Strands Harness 为开发者提供了一个配备文件、shell 和 Web 工具的工作 Agent,同时内置了上下文管理、记忆、持久化会话、prompt 缓存,以及向其他 Agent 委托任务等功能。
各个 Agent 可以针对不同的工作进行定制,开发者能够修改其指令、选择使用的模型、控制哪些工具和能力对其可用,以及决定是否可以将工作移交给另一个 Agent。

Strands Harness 本身大部分功能并不依赖 AWS 基础设施。Agent 循环、工具、上下文管理、会话处理和委托功能都包含在开源版本中,AWS 表示这些进程默认在运行 Agent 的机器上执行。
唯一的例外是对底层模型的调用。AWS 通过 Amazon Bedrock(其用于访问和运行基础模型的托管服务)来路由模型访问,这并不令人意外。不过,虽然 Brooker 表示这是唯一默认绑定到 AWS 基础设施的部分,但这一项也可以被替换。
"只需一行代码即可轻松覆盖,改用其他模型提供商,"他说道。
Strands Harness 也可以选择 Anthropic、OpenAI 或 Google 作为其模型提供商,或者通过 Ollama 使用本地运行的模型。更改提供商不一定意味着更换底层模型,但 Brooker 指出,选择不同的模型显然会影响 Agent 的行为。
"不同模型在推理、工具使用和成本方面各有优势,"他继续说道。"不会改变的是:上下文管理、会话、工具、委托等功能在不同的提供商下都以相同方式工作。没有任何功能需要依赖 Bedrock。"
值得注意的是,所有其他默认配置也都可以被修改。开发者可以引入自己的工具和能力、连接 MCP 服务器、改变上下文的处理方式,以及选择会话状态的存储位置。
Brooker 表示:"开发者可以专注于自己应用的任务和领域专业知识,同时定制需要不同行为的组件。"
AWS 表示,Strands Harness 被定位为通用型 Agent,而非编码助手,尽管它借鉴了 Claude Code 和 Codex 等 harness 的设计理念。AWS 声称,区别在于开发者可以将 Strands Harness 部署到自己选择的云服务提供商上——这解决了其描述的使用 Claude Code 和 Codex 的开发者普遍希望能够在云端运行相同设置这一常见诉求。
Strands Harness 还配备了一个用于原型设计和交互式配置 Agent 的 CLI。开发者可以选择模型、添加 prompt、工具和其他能力,然后使用 /export 将生成的 Agent 导出为 Python 或 TypeScript 代码。
AWS 还提供了一个 Agent Skill,旨在帮助编码 Agent 理解 Strands Harness 本身,包括如何添加 MCP 服务器或为 AWS、GCP、Azure、Cloudflare 和 Modal 等提供商生成部署配置。

从其自身测试来看,AWS 表明,即使底层模型保持不变,harness 管理周围 Agent 机制的方式也会对成本和性能产生实质性影响。对于每个 harness,AWS 在六个基准测试中平均其得分——ALFWorld、ContextBench、GAIA、WebShop、τ³-bench 和 Terminal-Bench 2.1——并将其与同一测试中每个任务的平均成本进行比较。AWS 特别指出,与 Claude Code 和 Codex 相比,Strands Harness 成本降低了 45%,同时准确率基本相当。
不过,一旦将 DeepSeek Harness(AWS 表示在匹配运行中比 Strands Harness 成本低约 14%)纳入更广泛的比较,这一数字就降至 28%。
AWS 特别指出,其上下文管理默认配置是取得这一结果的主要原因。Strands Harness 会对特别大的工具输出进行截断,一旦可用窗口超过设定阈值就压缩上下文,并在上下文溢出时尝试在 Agent 循环内恢复。
在 Terminal Bench 2.1 上,AWS 表示 Strands Harness 运行 Fable 5 的成本比 Claude Code 低 77%,在 89 次试验中分别为 56.29 美元和 248.05 美元,同时得分分别为 69.7 和 61.8。DeepSeek Harness 成本更低,为 40.30 美元,但其得分也较低,为 59.5。


对于 AWS 而言,这些结果有助于论证将上下文管理等功能的封装和调优打包提供的价值,而非要求每个开发者使用 SDK 独立做出这些决策。
"让原型跑起来是一步;评估这些选择如何影响性能和成本是另一步。"
Brooker 表示:"我们看到的这个机会,是将那部分工程工作封装成一个完整的通用型 Agent。"
AWS 也有一个天然的 Agent 运行场所。Amazon Bedrock AgentCore 是其用于部署和运营 Agent 的托管服务,提供身份和访问控制、可观测性以及托管所需的基础设施。
事实上,这个开源项目与该托管服务之间存在紧密的技术关联。AgentCore Harness 和 Strands Harness 由同一团队构建,尽管它们存在于独立的代码库中。Brooker 表示,其中一个项目的工作也可以为另一个项目带来改进,使 AWS 有一条清晰的路径将从开源项目开发的技术引入其托管服务,反之亦然。
Brooker 再次强调,Strands Harness 可以独立于 AgentCore 部署,完全在 AWS 之外运行。
"AgentCore 是为那些希望 AWS 管理基础设施侧的团队提供的一个可选托管层,"他表示。"但是,所有部署路径都向开发者开放,由他们自行选择。"
不过,这种安排为 AWS 提供了一条清晰的商业路径:开发者可以自由采用 Strands Harness,而 AgentCore 则为公司提供了一个自然的目标,用于那些最终希望由 AWS 运行周围基础设施的团队。
Strands Harness Agent 预计于本周一稍后正式上线。The New Stack 将在其上线后更新本文。