前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8741
  • Strands Evals + Bedrock AgentCore:Agent 技能选择评估指南
  • llm-anthropic 0.29支持Claude Opus 5.5
  • Claude Opus 5.5发布:性能持平Fable 5.1,定价直降40%
  • GitHub Copilot上线Claude Opus 5.5,支持长时Agent任务
  • GitHub Copilot 新增 GPT-6 Sol/Luna 模型选项
  • Claude Opus 5.5 智能/性能/价格深度分析
  • Anthropic发布Opus 5.5降价20%,但Agent调用可能暗中路由至旧模型
  • Anthropic称Opus 5.5为「史上最强」,定价更低的Fable级性能
  • Anthropic 发布 Claude Opus 5.5:强化网络安全防护,遏制越狱行为
  • Claude Opus 5.5 正式发布:832 分成社区热议
  • 生产级 AI 语音 Agent 架构:WebSocket 与延迟优化实战
  • Permission Envelope:让 AI 权限自动过期的安全控制机制
  • llm-typesafe插件支持Jev模型二元判断
  • Python AI Agent 上线前必读:测试、可观测性与零成本方案
  • Cloudflare Worker Previews:为 Agent 每次变更提供隔离预览环境
  • NVIDIA Isaac ROS 5.0 发布:加速 Agentic 机器人开源开发
  • Meta Muse macOS 应用零日漏洞遭修复
  • 小米6天烧2000万训练开源模型MiMo,跃居开放模型榜首
  • LLM应用输入输出Guardrails实战指南
  • Claude发现libheif堆缓冲区溢出:HEIC图片供应链安全研究
  • 多模型调度与反馈闭环:基元律动CTO谈Agent持续进化
  • 阮一峰科技周刊第413期:再见了React Native
  • 用Python/ChromaDB/Gemini搭建轻量级RAG实战
  • 生产环境中降低LLM成本的七种实战方法
  • AI驱动开发反思:过度规格化反而拖累AI编程
  • AMD ROCm:AI Agent正在降低GPU编程门槛
  • 小米MiMo-V2.6-Pro登顶开源权重模型榜首,300万美元预训练
  • 四Agent并行:状态文件是保持一致性的关键
  • 长任务前何时压缩上下文:Claude Code实战经验
  • 5美元/月自建Qwen2.5 72B推理服务:vLLM+AWQ量化部署指南
  • Prompt缓存失效的根因:工作流在悄悄破坏精确前缀匹配
  • NVIDIA SoL-Pi:编码Agent的Token流量降低49%的Auto-Research框架
  • Grok 4.7 发布:更大基座、同价位,编程与 Agent 任务升级
  • vibe coding 两小时后质量崩塌的根因分析
  • 用 git 在多设备间同步 Claude Code 和 Codex 会话
  • 小米 MiMo-V2.6-Pro 开源:科研任务效率提升 10 倍
  • 评估Agent代码补丁前先清点测试面
  • 阿里云栖大会:Qwen4训练中,全模态模型新版本亮相
  • Qwen4.5后参数扩展至5-10T,Qwen4和视频模型均在训练
  • 阿里云栖大会正式发布Qwen4
  • 凌晨3点LLM路由崩溃排查:上游回收引发的级联故障
  • Hugging Face Transformers现已支持运行llama.cpp量化模型
  • Jev:按输入计费的决策模型,输出免费
  • Langflow OSS 认证 RCE 漏洞 CVE-2026-17633
  • 小米 MiMo-V2.6 开源:AA 指数最高开源模型
  • xAI发布Grok 4.7:编程强化模型,百万词元2美元起
  • Meta AI 助手 Muse 存在关键 0-day 漏洞,ClickFix 攻击可劫持
  • AWS发布Strands Harness:开源Agent框架,Token成本降28%
  • Spec-Driven 开发:摆脱 Vibe Coding 的工程化实践
  • AI 编程助手 CSS 好看但上生产就崩的根因与修复
  • Agent 诊断结果上线前如何验证:分离决策与执行
  • 已加载 51 / 8741
8.0
热点
AI SCORE
编程提效2026-09-22 18:06

多模型调度与反馈闭环:基元律动CTO谈Agent持续进化

量子位#Agent#多模型调度#架构
Editor brief · 编辑速览

云栖大会演讲,探讨从多模型调度到RSI飞轮的Agent架构实践,强调反馈闭环对Agent能力提升的作用。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

9月22日,在2026杭州云栖大会企业级Agent实践峰会上,基元律动联合创始人兼CTO韩凯发表演讲《从Harness到RSI飞轮》。

他认为,多模型长期异构并存、算力资源多元供给,将成为大模型产业的长期结构。随着Agent承担越来越复杂的任务,如何组织不同模型,并将应用中的反馈转化为模型改进的依据,正在成为新的技术课题。

据国家数据局披露,2026年3月,我国日均Token调用量已超过140万亿,较2024年初增长超千倍。韩凯在分享中指出,一次复杂Agent任务往往涉及十余次乃至数十次模型调用。任务表现既取决于模型本身,也取决于支撑任务执行的系统能力,包括模型选择、工具调用与上下文管理等。

Harness是支撑Agent执行任务的运行框架,模型路由是其中的一项关键能力。在韩凯看来,不同模型在能力、成本和响应速度上各有特点,复杂任务需要根据每一步的需求选择合适的模型。模型异构适配与算力异构调度,也需要相应的专业能力支撑。

基元律动以开源项目OpenSquilla探索这一方向。据公司公布的端到端Agent评测结果,在特定测试配置下,OpenSquilla保留了固定旗舰模型基线99.96%的任务质量,同时将成本降低88.9%。在另一组DRACO深度研究评测中,多模型协同配置的得分超过该组实验中的最强单模型基线,成本约为其三分之一。这些结果展示了模型调度在特定任务中的成本与效果优势。

"路由层的价值,在于让每一步任务用对模型、用得起模型。"韩凯说。

在模型调度之外,韩凯进一步介绍了面向RSI(递归式自我改进)的反馈闭环:以场景中的能力需求为牵引,通过评测识别模型与调度策略的改进方向,开展针对性优化,再将升级后的能力应用于场景中验证效果。这一机制将模型应用、能力评测与后续迭代连接起来,探索Agent在持续验证与优化中提升任务表现的路径。

9月发布的NeoHorse-1是这一路径的初步验证。该系列模型基于通义Qwen3.5底座完成后训练。根据其初版技术报告,在十项基准评测中,4B版本的宏平均得分由58.94提升至64.87,9B版本由65.60提升至69.04。其中,4B后训练版本在VitaBench、τ²-Bench、PinchBench、QwenClawBench和HumanEval五项评测中超过Qwen3.5-9B底座模型,整体平均得分也进一步接近9B底座。这一结果初步展示了利用Agent运行经验改进模型的可行性。

在合作层面,据韩凯介绍,基元律动与阿里云围绕Qwen系列开展场景测试、评测和应用验证,在自身Harness与Agent产品中持续使用模型、积累反馈,并推动新版本接入TokenRhythm路由平台。同时,基础设施方面,阿里云为相关业务运行提供云服务支持,无问芯穹为NeoHorse-1的训练与推理提供算力支持及基础设施优化。

从Harness到RSI,基元律动希望将模型调度与模型迭代连接起来,一方面,让已有模型在合适的任务中发挥能力;另一方面,让任务执行过程中积累的经验进入后续训练与评测,逐步探索Agent持续进化的路径。

本文由基元律动提供,量子位获授权转载,观点归原作者所有。

Original source

本文由 AI 翻译整理自 量子位,原文版权归原作者所有。

阅读英文原文
上一篇
Claude发现libheif堆缓冲区溢出:HEIC图片供应链安全研究
下一篇
阮一峰科技周刊第413期:再见了React Native