Contrastive-LM发布CLM-8B开源模型,用对比学习替代文本生成来评分候选动作,在多个基准上超越Jev。
Contrastive-LM 发布了 CLM-8B,这是名为 Contrastive Language Models(CLMs)新类别的首个开源模型。CLM 不生成文本,而是对当前状态下的一组候选 action 进行评分并返回概率。其主要对比基准是 Jev,这是 TypeSafe AI 的专有 System One 模型。
能部署吗?能。Apache-2.0 的 head 权重为 75 MB,在 1 块 NVIDIA GPU 上运行,Linux 系统,由 vLLM 提供 Qwen3-8B encoder 的服务。
Jev 于 2026 年 9 月 15 日进入有限早期访问阶段。它返回带概率的类型化值而非文本。CLM 面向同一接口。其 CLM GitHub 仓库通过 TypeSafe 兼容 API 提供 CLM-8B,暴露 3 种问题类型:
Noul:返回陈述为真的概率。
Choice:从声明集合中选择一个选项,带概率。
Score:返回有序评分标准的预期等级。
为 TypeSafe API 编写的请求可以通过 CLM 的 Python 客户端重放。
CLM 用双向 InfoNCE 损失训练 state encoder 和 action encoder。每个 encoder 是冻结的 Qwen3-8B 主干加上 20M 参数的可训练投影头。训练将每个 state 推向实际执行的 action,推离其他候选。
推理时,CLM 通过 state 和 action 嵌入的点积对每个候选评分。对这些分数做 softmax 得到答案分布。同样的原语可以对 best-of-N 解决方案排名、对工具路由和对答案做类型化决策。
这种设计将 state 和 action 分离。在 agent 循环中,state 每步变化而 action 集基本固定。clm-serve 预留一块 GPU 内存,类似 vLLM 的 KV cache,复用缓存向量。在 1 块 RTX 4090 加 3 个 action 的配置下,重访 state 从 1.7 ms 降至 0.6 ms。模型卡片报告 CLM 在约 1000 个候选下比 Jev 快 13 倍。
在约 100K 保留问题上,单独预训练达到 52.1% top-1 准确率。中期训练提升到 69.2%。从硬负例开始训练在 62.4% 达到峰值,然后过拟合。
| Task | CLM-8B latency | Jev latency | CLM-8B success | Jev success |
|---|---|---|---|---|
| T-Rex game | 16.5 ms | 149.8 ms | 5/5 | 5/5 |
| Tool calling (BFCL v4) | 76.8 ms | 125.5 ms | 95.2% | 99.2% |
| WikiRacing | 79.8 ms | 225 ms | 26/30 | 30/30 |
| Super Mario | 33.5 ms | 132.6 ms | 5/5 | 5/5 |
9× 这个数字来自 T-Rex 游戏,那里的 action 在不同 state 间重复。CLM 在 T-Rex 和 Super Mario 上与 Jev 持平。在 tool calling 和 WikiRacing 上落后,同时在所有任务上运行更快。
这里 generator 采样多个候选解决方案,验证器选一个。Opus 5 生成 DeepSWE 候选项(best-of-4)。Fable 5 生成 Terminal-Bench 2.1 候选项(best-of-5)。团队评估了 38 个保留 DeepSWE 任务和 30 个保留 Terminal-Bench 2.1 任务。延迟在 H100 上测量。
| Benchmark | Pass@1 | CLM (fine-tuned) | Jev | CLM latency | Jev latency |
|---|---|---|---|---|---|
| DeepSWE | 73.7% | 81.6% | 79 ms | 449 ms | |
| Terminal-Bench 2.1 | 84.0% | 87.6% | 83.1% | 32 ms | 131 ms |
研究团队报告这些是新的 SOTA 验证器结果。Jev 在两个基准上都低于 pass@1,所以用 Jev 选择比取 1 个样本更差。CLM 运行快 4.1× 到 5.7×。这些数字使用轻量微调 head,不是零样本 checkpoint。是保留子集结果,不是完整 leaderboard 提交。
查看 Blog、Code 和 Data & Models。所有荣誉归该项目研究者。也欢迎在 Twitter 上关注我们,不要忘记加入我们的 150k+ ML SubReddit 并订阅我们的 Newsletter。等等!你用 telegram 吗?现在也可以加入我们了。
需要与我们合作推广你的 GitHub Repo 或 Hugging Face Page 或产品发布或网络研讨会吗?联系我们
Michal Sutter 是数据科学专业人士,拥有帕多瓦大学数据科学硕士学位。在统计分析和机器学习方面有坚实基础,Michal 擅长将复杂数据集转化为可操作的洞察。