基于SageMaker自托管Llama 4 Maverick与Guard 4,构建UK主权AI平台,RAG pipeline跑在pgvector上,50+ Agent用Strands Agents SDK编排。
在 UK 主权 AWS 架构上部署 AI Agent 需要在模型托管、数据驻留和 Agent 编排方面做出谨慎的决策。OneAdvanced 是一家总部位于英国的 Enterprise SaaS 提供商,服务超过 10,000 家客户,他们需要在确保没有任何数据离开英国的前提下提供 AI 能力。当时,他们想要的特定模型 Llama 4 Maverick 和 Llama Guard 4 尚未通过 UK 区域的托管服务提供。OneAdvanced 选择了一条不同的道路:在他们完全控制的 AWS 基础设施上自托管开源大语言模型(LLM)。
本文描述了 OneAdvanced 如何在 Amazon SageMaker AI 上使用 Llama 4 Maverick 和 Llama Guard 4 构建 UK 主权 AI 解决方案。该方案将基于 Amazon Aurora PostgreSQL 兼容版与 pgvector 扩展的检索增强生成(RAG)流水线、超过 50 个由 Strands Agents SDK 驱动的专业 Agent,以及运行在 Amazon Elastic Container Service(Amazon ECS)上的工具层结合在一起。我们将深入探讨架构、关键实现决策和成果。
挑战:数据主权与模型托管
OneAdvanced 为医疗、法律等多个受监管行业的组织提供行业聚焦的软件即服务(SaaS)解决方案。他们的客户每天处理敏感数据,包括患者记录、法律案件档案和合规文档。这些客户期望 AI 工具满足严格的数据驻留、安全和隐私标准。
OneAdvanced CTO Andrew Henderson 在 OneAdvanced AI 发布会上解释道:
"数据主权,尤其是在英国,是我们许多客户的硬性要求,尤其是公共部门和高度监管行业的客户。他们需要确切知道数据在哪里、谁有权限访问,以及数据是否位于英国法律和监管框架内,以支持完全合规和信任。"
OneAdvanced 最初使用 Amazon Bedrock 进行原型设计,在两周的冲刺中看到了快速成果:聊天补全、一个用于查询英国成文法的 Amazon Bedrock Agent、Snowflake 数据集成和图表生成。
然而,为了满足主权要求,OneAdvanced 需要仅在他们自己的英国 AWS 账户中托管模型。在这次合作期间,他们想要的模型 Llama 4 Maverick 和 Llama Guard 4 尚未通过 UK 区域的 AWS 托管服务提供。自托管意味着要部署、服务化和扩展这些模型,同时围绕它们构建生产级解决方案。这包括内容审核、文档检索、Agent 编排,以及面向非技术用户的无代码 Agent 构建器。
下图展示了 OneAdvanced AI 解决方案的高层架构。
图 1:OneAdvanced UK 主权 AI 解决方案的高层架构
该架构使 OneAdvanced 能够实现完整的 UK 数据主权和快速 Agent 部署,支持其 ISO 42001 AI 治理认证,同时保持对模型服务基础设施的完全控制。
该解决方案由四个组件组成。vLLM 在位于伦敦(eu-west-2)区域的 Amazon SageMaker AI 上托管 p5.48xlarge 实例上运行,为 Llama 4 Maverick(FP8)和 Llama Guard 4 提供服务。超过 50 个 Strands Agent 运行在 Amazon ECS 上,每个 Agent 有自己的系统 Prompt、工具配置和可选输入表单,Agent 配置存储在 Amazon DynamoDB 中。上传到 Amazon Simple Storage Service(Amazon S3)的文档被转换为 markdown、分块并嵌入 pgvector 以供检索。Llama Guard 4 在请求到达主模型之前检查用户输入中的有害内容。
典型请求的流程如下:用户发送消息,Llama Guard 检查其中是否有有害内容(在主推理模型之前评估)。请求被路由到 Amazon ECS 上相应的 Strands Agent。Agent 根据需要调用工具并从 pgvector 和 Amazon S3 检索相关文档,或调用包括网络搜索在内的专业工具。
要在 AWS 上自托管 AI 模型,需要以下资源和技能:
在 Amazon SageMaker AI 上部署模型
OneAdvanced 使用 vLLM 在 Amazon SageMaker AI 端点上托管 Llama 4 Maverick(meta-llama/Llama-4-Maverick-17B-128E-Instruct-FP8)和 Llama Guard 4(meta-llama/Llama-Guard-4-12B)。他们在伦敦区域使用 p5.48xlarge 实例部署,使用带有 AWS Deep Learning Containers 的 Hugging Face 模型。
更长的上下文窗口推动了向 P5 实例的迁移。OneAdvanced 以 120K–128K token 的上下文长度为目标,以支持大型文档分析和多轮对话等用例。在与 AWS 的 advisory 合作期间,使用 vLLM 在 P5 实例上进行负载测试,验证了基础设施能够满足他们的吞吐量要求。OneAdvanced 最初在 p4d.24xlarge 实例上运行,后迁移到 p5.48xlarge 用于生产,同时还利用了 GPU 计算的预留实例折扣。
Llama Guard 4 替换了早期部署的 Llama Guard 3,因为 OneAdvanced 观察到先前版本的高误拒率。Guard 模型在主模型之前串行运行,在推理开始前筛查用户输入中的有害内容。
使用 Strands Agents SDK 构建超过 50 个 Agent
OneAdvanced 解决方案的一个独特方面是其 Agent 库:超过 50 个跨医疗、法律、HR、营销、物流等领域的任务特定 Agent。Agent 包括护理事件响应助手、临床安全公告生成器、教育工作计划生成器、运营场景模拟器、绩效评估助手、文档比较工具和 AWS 架构师 Agent 等等。OneAdvanced 在短短三周内从第一个 Agent 发展到超过 50 个,大多数 Agent 在不到一天内构建完成。
OneAdvanced 评估了多个 Agent 框架,包括 LangChain、LangGraph 等,然后选择了 Strands Agents SDK。决策取决于几个因素:Strands 采用模型优先的方法,没有僵化的工作流定义;它支持轮流对话和采访式交互;它让 OneAdvanced 能够从想法快速迁移到已部署的 Agent。正如 OneAdvanced 首席软件工程师 Nick Heap 所解释的:
"评估后,Strands 作为该项目的明确领跑者脱颖而出。它全面的工具套件不仅满足了我们的需求,还提供了与我们内部愿景高度契合的未来防护解决方案。"
每个 Agent 都用系统 Prompt、一组工具和可选的结构化输入表单来定义。Agent 被容器化并部署在 Amazon ECS 上,运行时配置存储在 Amazon DynamoDB 中。用户浏览 Agent 目录并选择适合其任务的 Agent。
OneAdvanced 还构建了一个无代码 Agent 构建器,非开发人员可以通过可视化界面创建和配置 Agent。用户定义 Agent 的角色,用拖放字段设计输入表单,使用引用表单字段的 @ 语法编写系统 Prompt(注入表单值),并从可用工具库中进行选择。这种设计使产品经理、临床医生和业务分析师无需编写代码即可创建 Agent。
Agent 从共享工具库中获取工具,包括计算器、图表创建、文件内容读取器、Mermaid 图表生成器、组织和个人知识搜索、电子表格查询(包括 Snowflake 集成)、文本文件查询、英国成文法搜索和网络搜索(按组织和按用户查询可选开启)。例如,Agent 可以查询 Snowflake 数据库,然后从结果中生成图表,全部在一次交互中完成。
OneAdvanced 还使用子 Agent 和高级 Agent 模式来在复杂交互中维护上下文窗口。一个值得注意的设计模式是采访式 Agent。有些 Agent(如战略思维助手)在提供建议之前会提出结构化问题:"问题 1/3:你的 AI 解决方案旨在解决哪些特定痛点?" 这是通过轮流对话而非期望用户预先提供所有内容来构建上下文的。专注的、引导式交互比开放式 Prompt 产生更好的结果。
RAG 系统使 Agent 能够访问个人和组织级别的文档集合。用户通过文件管理界面上传文档到 Amazon S3 上的个人空间或共享组织空间。文档被转换为 markdown 并分块为 2,048 token 的片段,然后嵌入 pgvector 以进行向量相似性搜索。对于超过分块大小的较长文档,递归摘要处理超出部分的内容。
对于嵌入,OneAdvanced 使用 intfloat/multilingual-e5-large-instruct 模型,因其强大的多语言支持和指令遵循能力而选择它。OneAdvanced 没有采用现成的 RAG 框架,而是构建了自己的检索系统,内部称为"Llamadex",使他们对流水线拥有完全控制。他们最初选择 pgvector 是因为其简单性以及快速投入生产的速度。随着解决方案的成熟,OneAdvanced 正在审查这一策略以评估替代方案。
当 Agent 需要回答基于上传文档的问题时,它调用适当的检索工具——"个人知识搜索"或"组织知识搜索"——查询 pgvector 并返回相关片段以及来源引用。用户可以准确看到哪些文档被用于生成响应,从而支持透明度和信任。
安全与负责任的 AI
安全贯穿 OneAdvanced AI 解决方案的每一层,这是服务于医疗和法律等行业每天处理敏感数据的客户的直接结果。
基础设施运行在伦敦 AWS 区域。没有用户数据离开英国。没有用户查询或响应被保留或用于模型训练。正如 Nick Heap 所写:
"一个仅托管在英国且数据不用于训练 AI 模型的 AI 服务,OneAdvanced 工程师无法访问这些数据。"
个人和组织空间中的上传文档完全隔离,甚至 OneAdvanced 员工也无法读取。Llama Guard 4 在用户输入到达主模型之前筛查有害内容。隐私控制在组织级别可定制。在基础设施层面,Amazon GuardDuty 在 Amazon S3 文档存储层提供威胁检测。
OneAdvanced 持有 ISO 42001 AI 治理认证——他们报告称是最早获得该认证的英国和欧洲组织之一。他们也是 EU AI Pact 的签署方,反映了其对产品和运营中负责任 AI 的积极态度。
通过 AWS advisory 合作,OneAdvanced 从原型到 UK 主权 AI 解决方案的生产部署。OneAdvanced 在伦敦区域的 P5 实例上部署了 Llama 4 Maverick,使他们能够完全控制模型服务基础设施,且没有数据离开英国。他们在短短三周内构建并上线了超过 50 个 Strands Agent,涵盖医疗、法律、HR、营销等多个领域的用例。该解决方案自 2025 年 7 月起投入生产,为客户提供服务已超过一年。它达到了目标性能指标。OneAdvanced 公开宣布这是英国首个面向企业的私有主权 AI,没有用户数据被保留、训练或记录。该合作获得了 5/5 的客户满意度评分。
"我们非常感谢这次合作,也非常享受合作的过程。我们学到了很多东西,这帮助我们向市场推出了一种独特的产品,由我们的战略合作伙伴提供支持和帮助。非常感谢所有直接或间接参与的人。"
——Alex Savage,OneAdvanced 集成主管
结论与后续步骤
在本文中,我们展示了 OneAdvanced 如何通过在 Amazon SageMaker AI 上自托管 Llama 4 Maverick 和 Llama Guard 4、使用 Amazon ECS 上的 Strands Agents SDK 编排超过 50 个专业 Agent,以及通过基于 pgvector 的 RAG 流水线将响应基于客户文档来构建 UK 主权 AI 解决方案。结果是一个满足严格数据主权要求的生产级 AI 解决方案,同时为受监管行业的企业客户提供实用的 AI 能力。
OneAdvanced 最近实现了使用 LLM-as-a-judge 进行情感分析的评估框架,用于持续质量改进。他们的路线图还包括帮助用户优化 Prompt 的后端系统,以及在版本转换期间运行并行 LLM 模型以为最终用户保持稳定性。
如果你正在考虑类似的方法,请首先评估你的数据主权要求并确定需要自托管哪些模型。OneAdvanced 在 Amazon Bedrock 上进行了为期两周的原型设计以验证用例,然后才投入自托管基础设施。有关在 Amazon SageMaker AI 上部署模型的更多信息,请参阅 Amazon SageMaker AI 开发者指南。要开始使用 Agent 工作流,请访问 GitHub 上的 Strands Agents SDK。
要了解更多关于 OneAdvanced 构建 AI 解决方案的历程,请参阅 Nick Heap 在 OneAdvanced 招聘博客上发表的文章《The AI race and how we fully embraced velocity》。
如果你有类似的用例并想探索在 AWS 上部署主权 AI,请联系你的 AWS 账户团队。