前端进阶之旅前端进阶之旅
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
基础篇
进阶篇
高频篇
精选篇
手写篇
面经篇
AI 篇
原理篇
每日一题
小程序题库
知识卡片NEW
  • 历年面经按年份追踪真实考点
  • 算法题库NEW在线编码即时判题
  • 专项自测100 题快速查漏
  • 业务场景题真实业务问题与追问
  • 查漏补缺常见问题解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • 前端基础
    • HTTP从报文一路讲到 HTTPS
    • 浏览器渲染、事件循环、进程
    • 计算机基础Linux、网络、操作系统
  • 进阶专项
    • 设计模式23 种模式怎么用
    • 前端系统进阶学习大型项目工程化
    • 前端综合文章长期沉淀的实践文
  • 工程与工具
    • Node学习指南从环境搭建到服务端
    • NPM工作流script、依赖与发布
    • Docker容器化部署上手
    • Canvas图形与动画实战
  • 路线与导图
    • 思维导图知识点全景图
    • 学习路线按图索骥不跑偏
    • AI 定制路线NEW按你的简历现排
    • AI 知识地图NEW串起全站知识点
  • 动态
    • AI 热点NEWAI 每日动态
    • 公众号动态公众号历史文章
    • 博客动态站长的技术博客
    • 开发者导航常用工具与文档站
AI 助手NEW
旧版
返回 AI 情报前线
All News · 全部资讯8836
  • AI 编程 Agent 工具输出遭截断:应记录 stdout_bytes 和截断标志
  • Anthropic工程师揭秘:Claude为何越进化写作越差
  • Gemini 3.8 Flash / Flash-Lite TTS 发布:千款语音、30秒克隆、逐行台词控制
  • 工程师详解:新版Claude为何写作风格变得怪异
  • 小米MiMo-V3将搭载HySparse 2:100万Token下KV缓存缩小4.5倍
  • GitHub Copilot 应用新增本地沙箱隔离功能
  • AI Agent 调试指南:重启不是调试,七层架构定位根因
  • AI 加剧软件供应链攻击威胁,行业如何应对
  • 阿里 Qwen Audio 3.1 发布:语音识别/TTS 多模型,API 价格最高降 95%
  • Claude Code部署到Lizard平台实战指南
  • Claude Opus 5.5降价却破坏四个Agent依赖项
  • OpenAI GPT-6 Sol/Luna 半价发布,缓存机制或为更大降本杠杆
  • treg:聚合 3000+ Agent 工具的统一网关
  • 向量检索权限校验应内嵌到 pgvector 查询中
  • Univer:面向 AI Agent 的开源办公套件 SDK
  • DeepSeek公开Agent训练新论文,梁文锋署名
  • 为 AI 编程 Agent 构建可复用技能系统的实践
  • DeepMind研究:百个AI智能体协作求解时出现作弊与告密现象
  • Google AX:开源Agent编排运行时
  • 阿里千问发布Qwen-Audio-3.1:TTS降价70%、ASR降价95%
  • 诺基亚开源AnyJev:无训练即可将任意开源LLM转为校准决策模型
  • 2026年AI网关横评:Bifrost领跑,多路 failover 哪家强
  • GPT-6 Sol/Luna 发布:准确率翻倍、成本减半,价格战开启
  • Claude Opus 5.5 登场,AI 模型价格普降 40-50%
  • Kyutai开源语音模型Voice of Reason,口算GSM8K准确率从27%升至77%
  • 微软Copilot大促:10万席最高半价,向超级AI应用转型
  • OpenAI GPT-6 Sol/Luna:API价格腰斩,长任务Prompt缓存优化
  • AI 编码 Agent 在移动端多久“看”一次才够用
  • GPT-6 Astra 引领 3D 生成技术,竞争格局生变
  • Claude Opus 5.5 缓存读取降价 60%,68 万行代码迁移攻略
  • 用 AI 辅助求职的工程实践:诚实原则与确定性设计
  • Agent 补丁评分卡:防止测试被悄悄弱化的 CI 策略
  • Opus 5.5 缓存降价后 text-to-SQL 成本重算分析
  • Slack推出Code Channels:团队对话内集成AI编程助手
  • GPT-6 Sol/Luna 登场:价格腰斩,定位细分
  • TypeSafe Jev:让AI返回结构化决策而非段落文本
  • Text-to-SQL访问控制:身份决定Schema可见性
  • Jev 1.13实测:工单分类精度达100%,对比规则引擎和本地LLM
  • GitHub Copilot应用支持OpenTelemetry可观测性配置
  • Copilot for JetBrains新增工具审批和Agent控制功能
  • 两款 AI 代码审查基准测评结论相反
  • AI 编码提速后:验证环节成为新瓶颈
  • AI 审查同一 PR 给出不同结论:确定性判定器来解决
  • AI计量工具审计启示:独立交易ref是防重复计费的关键
  • OpenAI发布GPT-6 Sol/Luna:API价格下调50%
  • GPT-6/Claude 5.5 同日发布:价格战开打,Luna 成本腰斩
  • GitHub Copilot 大幅提升C++代码索引速度
  • Anthropic和OpenAI同时推出性价比新模型
  • GPT-6 提示缓存重大升级:更高命中率与可诊断性
  • 六边形架构的端口在撒谎:HTTP 不等于业务语义
  • GPT-5.6 价格策略解读:Luna 降价 80%,多版本差异化定位
  • 已加载 51 / 8836
8.0
热点
AI SCORE
开源项目2026-09-23 15:09

诺基亚开源AnyJev:无训练即可将任意开源LLM转为校准决策模型

MarkTechPost#开源#决策模型#Python
Editor brief · 编辑速览

AnyJev是诺基亚应用研究团队开源的Python库,无需微调即可将任意开源LLM用于固定选项的决策任务(如分类、排序),基于概率校准提升决策可靠性,Apache-2.0协议,可直接从PyPI安装。

文章思维导图
Knowledge map
拖拽缩放
Full translation

完整中文译文

Nokia 的应用研究团队开源了 AnyJev,这是一个 Python 库,可以在无需训练的情况下将任意开源 LLM 转化为决策模型。它瞄准的是一类常见的产品场景:从固定选项中挑选一个答案,而不是生成一段话。

它可以部署吗?可以,从 PyPI 安装,基于 Apache-2.0 开源,提供 transformers 和 vLLM 后端,支持共享前缀打分。

AnyJev 的接口设计借鉴了 Jev。Jev 是 TypeSafe AI 于 2026 年 9 月推出的 System One 决策模型(我们的报道)。向 AnyJev 传入一个带类型的提问,会返回一个附带了概率的决策结果,概率可以设阈值。这个概率直接取自模型的下一个 token 分布。不生成内容、不解析文本、不做任何训练。

该库支持 3 种提问类型:

Choice question:从 K 个选项中选出一个。

Noul question:二选一(是/否)。

Score question:将答案归入若干有序区间之一。

直接读取 Logits 的问题

许多开源项目已经在用这种方式:把选项标签限制为下一个 token,然后读取分数。Nokia 研究团队指出了这一捷径的两个缺陷。其一,选项顺序变化时,答案可能改变。其二,概率没有经过校准。

levels 文档指出了两个成因:

第一个是先验偏差:模型天然偏好某些标签,例如无论输入如何都更倾向"Yes"而非"No"。

第二个是位置偏差:模型天然偏好选项列表中的某些槽位。

AnyJev 的工作原理:L0 和 L1

每个决策都带有一个 level 字段。

L0(零标签,默认开启) 应用了两项修复:

循环移位。对于有 K 个选项的提问,列表会以 K 种轮转方式各展示一次,这样每个选项都会出现在每个位置上一次。结果在 log 空间以几何平均数合并。如果位置偏差在 logit 空间是加性的,这可以将它精确消除。

先验修正。默认情况下,AnyJev 使用批量校准。它在真实输入上维护一个预测分布的滑动均值,然后在强度 0.75 下将其除掉。修正从第 8 个样本开始生效。

L0 每个决策需要 K 次 prefill,通过共享前缀批量化。在单卡 H100、batch=32、K=20 的条件下,每次决策约耗时 0.25 秒。

L1(每个问题 100 到 500 个标签) 在 L0 基础上增加了温度缩放。拟合值保存为一个小 JSON 产物。L1 改变置信度的形态,但不会改变答案的排序。

在 Qwen3-8B 配合 BANKING77(20 选一、300 条测试样本)上,数字如下:

Metric Raw logits AnyJev L0 AnyJev L1
Labels required 0 0 100 to 500
Flip rate when options reversed 0.230 0.073 0.077
Accuracy 0.747 0.803 0.807
Calibration error (ECE) 0.240 0.184 0.095
Auto-decidable at 5% error 7.7% 46.3% 52.0%

仓库中还有几个其他结果:

L0 在全部 9 个模型和任务组合的测试中,都降低了顺序翻转率。

在一个 typed-decisions 数据集上,Qwen3-32B 配合 L1 达到了 0.036 的 ECE,而 Jev 公布的数字是 0.144。在准确率上,微调后的 Laya 仍然领先。

完整的消融实验表覆盖了 Qwen、OLMo、Granite、Phi 和 Mistral 模型。

Wu 表示,团队在一个内部 Nokia 路由问题上试用了 AnyJev,看到了不错的结果。

# pip install "anyjev[hf]"
from anyjev import Decider, Question
from anyjev.backends.hf import HFBackend

d = Decider(HFBackend("Qwen/Qwen3-8B"))
route = Question.choice("Which team should handle this?",
                        ["billing", "technical", "sales", "other"], name="route")
r = d.decide({"conversation": [...]}, [route])
r["route"].distribution   # probabilities per option

在服务侧,用 prefix caching 启动 vLLM,然后将 VLLMBackend 指向它即可。


AnyJev 将开源 LLM 转化为 Jev 风格的带类型决策模型,无需任何训练。

L0 使用循环移位和批量先验消除位置偏差和标签偏差。

在 Qwen3-8B BANKING77 上,选项翻转率从 0.230 降至 0.073。

L1 在 5% 误差下可自动决策的流量从 7.7% 提升至 52.0%。

已在 PyPI 上以 Apache-2.0 开源,提供 Hugging Face 和 vLLM 后端。

Original source

本文由 AI 翻译整理自 MarkTechPost,原文版权归原作者所有。

阅读英文原文
上一篇
阿里千问发布Qwen-Audio-3.1:TTS降价70%、ASR降价95%
下一篇
2026年AI网关横评:Bifrost领跑,多路 failover 哪家强