前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8836
  • 我用 Claude Code 九天给 47 个服务接入 OpenTelemetry 链路追踪
  • Google Gemini CLI新增文件修改确认机制
  • DeepSeek推理优化:内核补齐+通信重构,吞吐翻7倍
  • Hugging Face推出LFM2.5-VL-DSpark视觉语言模型加速方案
  • 管理 15 万 AI Agent 对数据库团队的挑战与变革
  • Cursor 收购 Firetiger 后一月推出代码变更生产追踪 Bot
  • OpenAI AI Agent 自主入侵澳大利亚政府网站
  • Claude Code 实际项目开发全流程复盘
  • Google Cloud Developer 插件让 AI 编码助手直连云端部署
  • OpenAI Agent 入侵澳大利亚 Medicare 统计门户
  • Google DeepMind负责人透露Gemini 4即将发布
  • Impeccable:AI 编程代理的确定性设计语言框架
  • AI Agent 生产环境失败启示录:构建攻击性测试
  • 金融合规监控系统的工程实践:数据管道、Agent 架构与审计日志
  • 2026 年十大 LLM 网关横评:语义缓存与多提供商故障转移
  • codebase-memory-mcp:毫秒级代码知识图谱MCP服务器,158语言支持
  • Strands Agents:开源AI Agent开发框架,支持Python/TS全生命周期管理
  • 2026年9大开源LLM网关生产级对比:Bifrost领先
  • 用 TigerGraph+MCP 构建自主欺诈调查 Agent
  • Jev 决策模型真实成本拆解:何时省钱何时烧钱
  • 开源CLM-8B:Agent动作评分比Jev快9倍
  • JEV:打破布尔二值困境的类型安全验证方案
  • Claude Opus 5.5降价40%逼近前沿性能
  • VS Code 1.139:Agent 会话首次加载提速约 12 倍
  • 定时 Agent 总重复干活?用完成分类账让它知道什么是「做完」
  • TypeSafe AI Jev 编码指南:类型化决策、置信度校准与推测式广播
  • Vercel Connect 新增 TanStack AI 集成
  • Anthropic与OpenAI 90分钟内相继降价
  • 选LLM API的六个价格陷阱
  • Agent记忆正常仍出错:问题在状态不在记忆
  • Mercury 2.5 推理速度达 770 tokens/秒
  • GitHub Copilot 代码审查新增个人配置选项
  • MCP单人上手容易,团队规模落地是另一回事
  • 影子测试100%一致率背后:模型实际正确率仅75%
  • 两个都通过的测试,代价却不同:重试的隐性成本
  • 定时运行AI Agent输出飘移的根因与修复
  • Anthropic如何两周将Claude.ai速度提升3倍
  • claude-code-templates:一键装配 Claude Code 开发套件,含 100+ Agent/MCP
  • Agent 删改测试必须拦截:CI 合并门禁实操方案
  • Google Antigravity SDK 支持本地 AI 模型:Gemma 4 26B 可离线跑
  • NVIDIA Warp 与 MjWarp 加速机器人仿真工作流
  • HEMA 用 MCP 和 Amazon Bedrock 实现内部 AI 助手转型
  • 五大LLM网关工具生产环境横评
  • GitHub Copilot应用如何渲染百万行PR
  • 基于 AWS 构建 Agent 式视频智能对话系统架构解析
  • Bedrock 上用开源权重模型做 AI 编程助手
  • Anthropic 实验室:Claude 自主发现类 CRISPR 新型酶系统
  • ChatGPT Voice 集成邮件、日历和 Slack:Altman 心中的"Her"更近一步
  • OpenAI GPT-6 Sol/Luna 和 Claude Opus 5.5 同步降价 50%
  • AI 工具循环必须显式传递 Retry-After 头否则必死循环
  • AI 代码补丁静默引入新工具调用:merge 前必须强制契约检查
  • 已加载 51 / 8836
8.0
热点
AI SCORE
开源项目2026-09-24 13:27

开源CLM-8B:Agent动作评分比Jev快9倍

MarkTechPost#开源#Agent#LLM评测
Editor brief · 编辑速览

Contrastive-LM发布CLM-8B开源模型,用对比学习替代文本生成来评分候选动作,在多个基准上超越Jev。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Contrastive-LM 发布了 CLM-8B,这是名为 Contrastive Language Models(CLMs)新类别的首个开源模型。CLM 不生成文本,而是对当前状态下的一组候选 action 进行评分并返回概率。其主要对比基准是 Jev,这是 TypeSafe AI 的专有 System One 模型。

能部署吗?能。Apache-2.0 的 head 权重为 75 MB,在 1 块 NVIDIA GPU 上运行,Linux 系统,由 vLLM 提供 Qwen3-8B encoder 的服务。

System One 模型的职责

Jev 于 2026 年 9 月 15 日进入有限早期访问阶段。它返回带概率的类型化值而非文本。CLM 面向同一接口。其 CLM GitHub 仓库通过 TypeSafe 兼容 API 提供 CLM-8B,暴露 3 种问题类型:

Noul:返回陈述为真的概率。

Choice:从声明集合中选择一个选项,带概率。

Score:返回有序评分标准的预期等级。

为 TypeSafe API 编写的请求可以通过 CLM 的 Python 客户端重放。

CLM 用双向 InfoNCE 损失训练 state encoder 和 action encoder。每个 encoder 是冻结的 Qwen3-8B 主干加上 20M 参数的可训练投影头。训练将每个 state 推向实际执行的 action,推离其他候选。

推理时,CLM 通过 state 和 action 嵌入的点积对每个候选评分。对这些分数做 softmax 得到答案分布。同样的原语可以对 best-of-N 解决方案排名、对工具路由和对答案做类型化决策。

这种设计将 state 和 action 分离。在 agent 循环中,state 每步变化而 action 集基本固定。clm-serve 预留一块 GPU 内存,类似 vLLM 的 KV cache,复用缓存向量。在 1 块 RTX 4090 加 3 个 action 的配置下,重访 state 从 1.7 ms 降至 0.6 ms。模型卡片报告 CLM 在约 1000 个候选下比 Jev 快 13 倍。

三阶段训练配方

  • 预训练:约 60M Nemotron DQA 问答对
  • 中期训练:约 30M 由 Gemini 2.5 Flash-Lite 生成的合成硬负例
  • 后训练:约 1M 来自 Agent Data Protocol、Endless-Terminals 和 LiteCoder-Terminal-SFT 的 agent 轨迹

在约 100K 保留问题上,单独预训练达到 52.1% top-1 准确率。中期训练提升到 69.2%。从硬负例开始训练在 62.4% 达到峰值,然后过拟合。

零样本对比 Jev

Task CLM-8B latency Jev latency CLM-8B success Jev success
T-Rex game 16.5 ms 149.8 ms 5/5 5/5
Tool calling (BFCL v4) 76.8 ms 125.5 ms 95.2% 99.2%
WikiRacing 79.8 ms 225 ms 26/30 30/30
Super Mario 33.5 ms 132.6 ms 5/5 5/5

9× 这个数字来自 T-Rex 游戏,那里的 action 在不同 state 间重复。CLM 在 T-Rex 和 Super Mario 上与 Jev 持平。在 tool calling 和 WikiRacing 上落后,同时在所有任务上运行更快。

CLM 作为 Coding Agent 的验证器

这里 generator 采样多个候选解决方案,验证器选一个。Opus 5 生成 DeepSWE 候选项(best-of-4)。Fable 5 生成 Terminal-Bench 2.1 候选项(best-of-5)。团队评估了 38 个保留 DeepSWE 任务和 30 个保留 Terminal-Bench 2.1 任务。延迟在 H100 上测量。

Benchmark Pass@1 CLM (fine-tuned) Jev CLM latency Jev latency
DeepSWE 73.7% 81.6% 79 ms 449 ms
Terminal-Bench 2.1 84.0% 87.6% 83.1% 32 ms 131 ms

研究团队报告这些是新的 SOTA 验证器结果。Jev 在两个基准上都低于 pass@1,所以用 Jev 选择比取 1 个样本更差。CLM 运行快 4.1× 到 5.7×。这些数字使用轻量微调 head,不是零样本 checkpoint。是保留子集结果,不是完整 leaderboard 提交。

Interactive Explainer

  • CLM-8B 对候选 action 评分而非生成文本
  • 零样本测试中延迟比 Jev 低达 9×
  • 微调 head 在 DeepSWE 上达到 81.6%,在 Terminal-Bench 2.1 子集上达到 87.6%
  • 缓存 state 和 action 向量削减 agent 循环延迟
  • Apache-2.0 head,在 1 块 NVIDIA GPU 上自托管

查看 Blog、Code 和 Data & Models。所有荣誉归该项目研究者。也欢迎在 Twitter 上关注我们,不要忘记加入我们的 150k+ ML SubReddit 并订阅我们的 Newsletter。等等!你用 telegram 吗?现在也可以加入我们了。

需要与我们合作推广你的 GitHub Repo 或 Hugging Face Page 或产品发布或网络研讨会吗?联系我们

Michal Sutter 是数据科学专业人士,拥有帕多瓦大学数据科学硕士学位。在统计分析和机器学习方面有坚实基础,Michal 擅长将复杂数据集转化为可操作的洞察。

Original source

本文由 AI 翻译整理自 MarkTechPost,原文版权归原作者所有。

阅读英文原文
上一篇
Jev 决策模型真实成本拆解:何时省钱何时烧钱
下一篇
JEV:打破布尔二值困境的类型安全验证方案