前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片
  • 场景篇按分类整理的大前端场景考点
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
  • 动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
  • AI 助手随时提问,即时解析
  • AI 模拟面试模拟真实面试 + 报告
  • AI 知识地图串起全站知识点
  • AI 定制路线按你的简历现排
AI 热点
旧版
返回 AI 情报前线
All News · 全部资讯9258
  • Hermes Soul:让Copilot外壳调用Agent工具链实现内联编辑
  • LLM幻觉深度解析:AI为何编造内容及工程应对策略
  • Playwright AI Agent:自主浏览器自动化的完整工程指南
  • 一致性≠正确性:企业AI需要持续评估的R.A.H.S.I.框架
  • LLM账单有两个杠杆,你们团队只拉了一个
  • SFT 中究竟什么被 token 化:chat template 底层机制详解
  • 社区平台工程指南:Feed不是查询
  • 发布MCP服务器前的安全检查清单
  • Agent工具调用劫持:注入模式与运行时防护
  • AI Agent成本预测:在用户点击运行前估算工作流开销
  • 为何 AI Agent 指令文件总在多台机器间漂移
  • AI 水印无法真正证明作者身份——而且这才是关键
  • 企业级 AI 编程 ROI 量化实践:LoongSuite-Pilot + SLS
  • AI Agent 缺控层:R.A.H.S.I. 框架解决生产级连续保障
  • Grok 4.6 发布:50 万上下文、xhigh 推理级,60 分跻身第一梯队
  • AI Agent 搜索落地指南:减少幻觉的四大实践
  • 截图搜索 App 实战架构:端侧 OCR + Gemini 分类
  • 幂等性:让发布 Agent 不怕中途被杀
  • AI Agent 安全:教程里不会教的防护层
  • 2026生产级AI Agent实战指南:评估体系、生产架构与竞争策略
  • 企业级多Agent架构设计:Agent Mesh实现跨框架互操作
  • 上下文工程:6 文件替代全量历史,Token 消耗降 84%、准确率升 39%
  • AI 编码 Agent 需要确定性验收边界
  • 批处理中的静默失败:十条日志全成功仅两条执行
  • Pest 5:用测试工作流重新定义 Agent 代码验证
  • AI Agent的记忆检索正常却答错了:信息过期的隐性陷阱
  • AI编程的质量瓶颈在于上下文,而非模型本身
  • 自进化AI Agent正在淘汰静态脚手架:2026技术架构解析
  • AMD收购Taalas:芯片级AI推理的时代来了
  • Embabel:JVM上的Spring之父新作,Kotlin编写的企业级Agent框架
  • 6000+评论揭示:Cursor是AI编程安全问题最多的工具
  • 2026年AI编程工具横评:9款主流Harness对比与模型选配指南
  • LTX-2:首个DiT架构音视频生成模型开源
  • 33个生产Agent运行经验:记忆持久化模式总结
  • VLM+DOM Diff实现低误报的UI回归测试
  • 新模型来了?先用自己仓库的历史 commit 跑一遍
  • 廉价新模型上线前,我用 2 小时金丝雀测试决定要不要切
  • 免费模型评测后再付费:AI 编程任务的评估工作流
  • Meta 30B本地Agent模型Mac实测对比
  • 用测试套件自动分流免费/付费模型的工作流
  • Switchyard:Rust 编写的 LLM 流量代理,支持 OpenAI/Anthropic 协议互转
  • RAGFlow v0.4:开源 RAG 引擎支持 DeepSeek v4 与多渠道聊天
  • 廉价模型优先、失败时升级:构建可审计的双层 LLM 流水线
  • Vercel实习生直参生产:CDN、v0、AI Gateway实战复盘
  • DeepSeek-V4-Pro 正式版:Agent 能力大幅提升,支持三档思考强度
  • 2026年Claude Code最佳替代工具横评
  • DeepSeek-V4-Pro 正式版发布:Agent 能力大幅提升,支持 Responses API
  • AI编程工具选型:别比补全速度,比执行位置
  • AI代码审查风险分级路由:用强模型只审高危diff
  • DeepSeek V4 Pro正式版发布,多项对标Fable 5
  • 把AI Agent的模型路由策略放进Git:账单降了代码才动
  • 已加载 51 / 9258
8.0
热点
AI SCORE
技术实践2026-08-13 14:00

企业级多Agent架构设计:Agent Mesh实现跨框架互操作

dev.to · AI#多Agent#架构设计#企业级
Editor brief · 编辑速览

探讨企业不应绑定单一Agent框架,需构建与框架解耦的动态路由架构,实现AutoGen、LangGraph等多种框架共存下的Agent互操作。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

TL;DR

为什么还在争论 LangChain、AutoGen 还是 CrewAI 才是组织的正确框架?这是一个错误的问题。企业现实是,你永远不会拥有单一的、统一的技术栈。不同业务单元有不同的需求、技能组合和遗留约束。强制使用单一框架只是用"框架锁定"换了一种"供应商锁定"。

正确的目标是构建一种与框架无关的架构——Agent Mesh。它将服务网格的成熟模式应用到 LLM Agent 领域,通过 Sidecar 代理、Agent 合约、注册中心和网关,实现跨框架的互操作性。


单体编排 vs. 分布式 Agent Mesh

评估从框架锁定的 Agent 链到解耦互操作层的转变,以支撑企业级扩展。

你可能已经读过关于从实验性到系统性 Agent 工作流的演进文章。这一演进的下一步是解决互操作性缺口。

定义 Agent Mesh:LLM 的服务网格

能否将微服务的经验教训应用到 LLM Agent 世界?可以,而且应该。"Agent Mesh"是一种架构模式,将 Agent 互操作性视为基础设施问题,而非应用问题。

在传统设置中,Agent A 通过硬编码的 API 调用或特定框架的连接器来调用 Agent B。这会产生紧耦合。如果 Agent B 更改了输入模式或迁移到不同框架,Agent A 就会崩溃。

Agent Mesh 引入了一个解耦的互操作层。这里我们应用 Sidecar 模式。每个 Agent,无论其内部使用何种框架,都配有一个 mesh proxy。这个代理负责"管道"工作:通信、发现、认证和可观测性。Agent 本身只关心任务本身;sidecar 关心的是如何将任务传递给下一个 Agent。

通过解耦通信层,你有效地中和了框架碎片化的问题。你的 LangGraph Agent 不需要知道自己在和一个 AutoGen Agent 通信。它只需要知道如何与 mesh 通信。这与云原生环境中服务网格的演进如出一辙——网络逻辑从应用代码中剥离,移入基础设施层 [ThoughtWorks Radar]。

跨框架请求流经 Sidecar 代理

架构图,展示请求从 Agent A 经由其 sidecar、跨越 mesh 到 Agent B 的 sidecar 的路径。

这种方法允许你将 Agent 视为可互换的组件。你可以将一个由 GPT-4o 驱动的 Agent 替换为一个专门的 Llama-3 微调版本,而无需更新依赖它的上游 Agent。这是管理当前企业 AI 生态系统状态的唯一方式,而不会创建一张无法管理的依赖网。

技术蓝图:合约、注册中心与网关

如何在不造成大规模瓶颈的情况下构建这个系统?你需要三个核心组件:Agent 合约(Agent Contract)、注册中心(Registry)和网关(Gateway)。

标准化 Agent 合约

当 Agent 无法就"请求"的格式达成一致时,互操作性就会失败。你不能依赖原始 JSON 提示词,因为它们太容易变化。你需要一个严格的 Agent 合约。

这个合约定义了任务交接和状态传输的通用模式。一个典型的合约应包括:

  • Task Intent(任务意图):目标的标准化标识符(例如 compliance.audit.verify)
  • Context Payload(上下文负载):执行任务所需数据的版本化模式
  • State Token(状态令牌):指向共享状态存储的指针,以避免在 Agent 之间传递巨大的上下文窗口
  • Termination Criteria(终止条件):Agent 应将控制权返回给 mesh 的明确条件
{
    "header": {
        "transaction_id": "tx-99821",
        "source_agent": "customer-front-end",
        "target_capability": "compliance.verify",
        "priority": "high"
    },
    "payload": {
        "customer_id": "cust_4412",
        "document_hash": "sha256:e3b0c442...",
        "jurisdiction": "EU-GDPR"
    },
    "state_ref": "redis://state-store/session-882"
}

集中式 Agent 注册中心

如果你有 50 个 Agent,就不能硬编码它们的端点。你需要一个充当 Agent 能力"黄页"的注册中心。

注册中心不仅存储 URL,还存储能力映射。当路由 Agent 需要"合规检查"时,它查询注册中心,找到当前持有 compliance.verify 能力且延迟最低或成功率最高的 Agent。这实现了动态路由。你可以部署新版本的合规 Agent,在 mesh 中注册它,流量会自动转移,而调用方 Agent 无需修改一行代码。

网关

网关是执行规则的地方。它是外部请求的单一入口点,也是内部 Agent 间通信的交通警察。

网关的关键职责包括:

  • 跨平台认证:确保来自低信任度 Agent 的请求不会在高权限金融 Agent 中触发高权限操作
  • 限流:防止递归循环在十分钟内耗尽你的 token 预算
  • 协议转换:将遗留系统的 REST 调用转换为 Agent Mesh 合约

Agent Mesh 功能栈

分层架构图,展示 Agent Mesh 的发现层、通信层和治理层。

运维 Mesh:可观测性与治理

当请求经过三个不同框架的四个 Agent 时,你能否准确知道它在哪里失败了?在单体设置中,你有栈追踪。在分布式 Agent 系统中,这是一场噩梦。

你必须从第一天就实现分布式追踪。每个进入 mesh 的请求都会获得一个唯一的 trace_id。这个 ID 会通过每个 sidecar 代理传播。

当你在监控 50+ Agent 的 token 消耗和延迟时,你不可能去查看单个日志。你需要一个统一的视图来可视化请求流。如果"客户 Agent"(LangGraph)调用"合规 Agent"(AutoGen),后者再调用"数据库 Agent"(Python 脚本),追踪应该显示每一跳的精确延迟和 token 成本。这对于识别链中哪个 Agent 是性能瓶颈至关重要。

护栏传播

治理不能是事后补救。如果你正在处理欧盟 AI 法案合规,就不能信任每个 Agent 实现自己的护栏。

Agent Mesh 允许"护栏传播"。你在 Mesh 级别定义策略(例如"禁止 PII 离开合规区域")。sidecar 代理在负载离开 Agent 边界之前检查负载来强制执行该策略。如果负载包含信用卡号且目标是低信任度 Agent,代理会阻止请求。Agent 甚至不知道请求被阻止了;mesh 处理了失败。

这正是确保策略一致执行的方式。你正在将"安全"逻辑从提示词中移出,放入基础设施中。

架构故障模式与缓解措施

分布式系统容易发生故障。分布式 Agent 系统容易发生奇怪的故障。

无限递归循环

这是多 Agent 系统中,最常见的故障模式。Agent A 发送任务给 Agent B,后者决定需要更多信息,再发回给 Agent A。它们会一直这样做,直到你的 API 预算耗尽或系统崩溃。

缓解措施:在 mesh 头部实现"跳数限制"。每次请求通过代理时,跳数递增。如果计数超过阈值(例如 10 跳),mesh 会终止请求并触发警报。

状态漂移与上下文不匹配

Agent A 可能拥有 128k 的上下文窗口,但 Agent B 只有 8k。如果 Agent A 在负载中传递整个对话历史,Agent B 会截断最重要的信息或完全失败。

缓解措施:使用"状态存储"模式。不要在消息中传递完整状态,而是传递共享缓存(如 Redis)中状态对象的引用。接收方 Agent 根据自身的窗口限制,只获取所需的特定上下文片段。

重试风暴

一个慢速 LLM 提供商的延迟峰值可能导致调用方 Agent 超时,后者再重试,给已经不堪重负的提供商增加更多负载。这是一个经典的重试风暴。

缓解措施:在 sidecar 代理中实现断路器。如果合规 Agent 连续失败三次,mesh 会"打开"断路器,在接下来的 30 秒内立即向调用方返回失败,让下游 Agent 有机会恢复。

提示词注入传播

一个低信任度的 Agent(如面向公众的聊天机器人)可能通过提示词注入被攻陷。如果该 Agent 可以通过 mesh 调用高信任度 Agent(如支付处理器),注入就会传播。

缓解措施:实现"信任区域"。Agent 被分配信任级别。mesh 网关阻止来自 Trust-Level: 1 Agent 到 Trust-Level: 3 Agent 的任何请求,除非请求经过"清理 Agent"——该 Agent 会剥离潜在的注入模式。

全能 Agent 瓶颈

许多团队构建了一个处理所有路由的单一"主编排器"。这个 Agent 成为了单点故障和巨大的性能瓶颈。

缓解措施:转向去中心化发现。让 Agent 查询注册中心,根据 Agent 合约做出本地路由决策。

从理论到生产:实现场景

为了让这更具体,让我们看看在高风险环境中这是如何工作的。

场景一:金融服务交接

一家金融服务公司的客户面向 Agent 是用 LangGraph 构建的,因为它在处理对话方面很灵活。然而,公司的合规逻辑是一组用 AutoGen 构建的复杂确定性规则。

没有 mesh 的情况下,LangGraph 团队需要编写一个自定义包装器来调用 AutoGen API,将 LangGraph 的状态映射到 AutoGen 期望的输入。如果合规团队更新了他们的 Agent,客户面向团队必须更新代码。

有了 Agent Mesh,LangGraph Agent 只需向 mesh 发送一个对 compliance.verify 能力的请求。sidecar 处理翻译。客户 Agent 不知道 AutoGen 的存在;它只知道合约。

场景二:零停机迁移

一个平台团队正在将遗留的单体 Agent 迁移到分布式系统。他们不能让系统下线。

他们实现了一个代理层。最初,代理将所有请求路由到遗留单体。随着他们剥离出新的专门 Agent,他们会更新注册中心。代理开始将特定能力(例如 report.generate)路由到新的分布式 Agent,同时将其他所有内容继续路由到单体。这允许对 Agent 架构进行金丝雀部署。

场景三:多业务单元集群监控

一家企业在 HR、财务和法律部门有 60 个 Agent。每个团队使用不同的模型和框架。CTO 需要一个统一的视图来了解总 token 消耗和延迟。

因为每个 Agent 都包裹在 mesh sidecar 中,平台团队可以从代理收集遥测数据。他们不需要对 Agent 本身进行插桩。他们获得一个实时仪表板,显示法律 Agent 由于一个低效循环消耗了 40% 的预算,而 HR Agent 正在经历 5 秒的延迟。这使得基于数据、而非猜测进行高风险故障恢复成为可能。


但请记住,Agent Mesh 不是你购买的即插即用产品。它是一种架构承诺。它要求你将合约置于框架之上。它意味着在投入提示词之前,先在注册中心和 Sidecar 上花费时间。

这是构建系统的唯一方式——不会在新的框架成为行业宠儿的那一刻崩溃。

%%{init: {'theme': 'base', 'themeVariables': { 'primaryColor': '#e1f5fe', 'primaryTextColor': '#1a1a1a', 'primaryBorderColor': '#0277bd', 'lineColor': '#546e7a', 'secondaryColor': '#f3e5f5', 'tertiaryColor': '#fff8e1'}}}%%
graph TB
    subgraph "External Systems"
        REST_API[REST API Gateway]
        Legacy_System[Legacy System]
    end

    subgraph "Agent Mesh Infrastructure"
        Gateway[Mesh Gateway]
        Registry[Agent Registry]
        subgraph Sidecars
            SC1[Sidecar Proxy A]
            SC2[Sidecar Proxy B]
            SC3[Sidecar Proxy C]
        end
    end

    subgraph "Agent Frameworks"
        subgraph LangGraph
            AgentA[LangGraph Agent]
        end
        subgraph AutoGen
            AgentB[AutoGen Agent]
        end
        subgraph Custom
            AgentC[Custom Agent]
        end
    end

    REST_API --> Gateway
    Legacy_System --> Gateway
    Gateway --> Registry
    Registry --> SC1
    Registry --> SC2
    Registry --> SC3
    SC1 --> AgentA
    SC2 --> AgentB
    SC3 --> AgentC
    AgentA <--> SC1
    AgentB <--> SC2
    AgentC <--> SC3

    style Gateway fill:#1565c0,color:#fff
    style Registry fill:#1565c0,color:#fff
    style Sidecars fill:#b3e5fc
Original source

本文由 AI 翻译整理自 dev.to · AI,原文版权归原作者所有。

阅读英文原文
上一篇
2026生产级AI Agent实战指南:评估体系、生产架构与竞争策略
下一篇
上下文工程:6 文件替代全量历史,Token 消耗降 84%、准确率升 39%