作者在构建 AI 路由系统时系统性评估了六款多 Agent 编排框架,发现无一能超越自研方案的边界,提出路由评判的核心标准:是否带来编排层本不存在的新能力。
六个候选方案都是编排器或多智能体框架,解决的是同一个问题:哪个模型负责哪个任务,以及如何信任返回的结果。
Fable Foreman 暂时搁置,值得关注。它与我们的路由策略几乎是一一对应的:能力等级分层、盲验证、预算感知调度。其价值在于设计层面的对比,而非新能力。彼时它才上线四天,三个核心特性中有两个被 CTA(行动号召)门槛拦着,根本没展示出来。
Ruflo 进入待定列表。100+ 预构建智能体、向量记忆、多模型路由、约 210 个工具集成、58k+ GitHub 星标且在增长。它卖的是同一个路由加验证循环,只是比我们做得更简单。
CrewAI skills 因重复而拒绝,非质量原因。它是一个合法的 55.5k 星父项目的官方插件脚手架,针对编排器、研究员、撰写者和审核员的团队。但同样的模式已经在工作流和路由层上运行了;引入第三方框架是在复制而非扩展。
9router 被坚决拒绝。它是所有模型提供商的凭证拦截代理,存在未认证的远程代码执行漏洞,CVSS 评分 10 分,同时任何通过它路由的订阅都面临服务条款风险。一个已有的备用方案可以安全地覆盖同样的需求。
Claude Council 是主动放弃的。确实是一个真正的多模型协商插件,表述也诚实,但它只是其他地方已有的模型小组模式的轻量版。
三个"智能体 OS"演示视频被拒绝,没什么要安装的。展示的是一个常驻多智能体生活 OS 的相机模拟稿。每一个命名部分(宪章文件、分层路由、对抗性辩论、成本账本、预算中止)都能对应当前已经在运行的组件,只是分离得更清晰、安稳。那个打包方案不过是把五个本来有意拆开的模式营销包装了一下。
第二个集群不负责任何路由。这些是桌面 Shell,用于在你已经决定好一个模型、选中它之后的扇出运行,因为不相关的原因被检查,而非与路由策略竞争。
Orca 经过手动验证确认。免费、在你自己的订阅下运行真实的 CLI;技能和插件对标没问题,工作树扇出加上 diff-merge 往返在一个临时仓库上端到端验证通过。12.1k 星。
Nimbalyst 进入待定列表。看板风格的并行会话,配合工作树隔离,暂停等待确认它与现有基于钩子的工作流配合良好。
DevSwarm 被拒绝。与 Orca 同类,但是闭源、付费、仅下载可用,公开仓库只是一个落地页,87 星。一个免费的替代方案已经过了同样的门槛,它没能超越。
两个输入通过了门槛,两者都是以想法而非安装的形式,从相反方向到来,落在同一个形态上。
一位陌生人的公开路由配置贡献了一个真正新的区分维度:品味作为一个独立于难度的轴。一个组件名称或营销话术容易计算,但仍希望使用品味最高的模型。仅按难度规则会错误地把它路由到更低的模型。这个维度现在是路由策略中的一个永久例外。同一个来源的"管理器从不运行高推理努力"规则被权衡后拒绝;它与保持终端审核和最难验证阶段刻意昂贵直接冲突。
另一篇关于文件系统即智能体架构的学术论文(编号阶段文件夹、每阶段上下文文件、阶段之间的人工门槛)最终与已使用的四文件工作笔记系统重叠约 80%。这是独立收敛,这次来自 arXiv 而非产品推销。
两者都没有产生依赖。都产生了已有事物的更强版本。
Fable Foreman 值得完整对齐,因为它是在内部构建最接近外部存在的东西。
市场一直在独立地重新发现同一个路由模型:陌生人的配置文件、一篇学术论文、三个病毒式演示视频、一个四天大的仓库——与我们自己的构建维度一一对应。没有一个成为依赖,因为同样的五个模式在任何候选出现之前就已经分解为可分离、可审计的组件了。
一个被拒绝的工具什么都证明不了;每个项目都会拒绝东西。值得注意是九个候选被检查、没有一个依赖被采用的形态。没有一个提供路由层还没有的能力,而那两个提供了真实东西的,结果是想法而非产品。如果底层问题(按可验证性路由、盲验证、设预算上限、保持人工在环)已经被充分理解,以至于独立的人都不断到达相同的四五块拼图——这正是你会预期的。
这种纪律不是拒绝去看。是不愿意用五块我们可以审计的东西去换一块我们无法审计的。这不是说没有更多值得检查的工具了。只是说每个出现在桌上的东西都用同一个门槛去衡量,而门槛守住了。
Originally published at thekilled.dev/convergent-evidence.