Ember-1通过对Kimi K3进行后训练,使其缩短推理链长度,生产环境测试节省约40% Token(49.3K→29.9K),分数基本持平,按K3定价提供API。
Fireworks AI 发布了 Ember-1,这是一款由 Fireworks Research 构建的专业模型,通过对 Moonshot AI 的开源权重模型 Kimi K3 进行后训练得到。Ember-1 学习在保持任务准确率的同时生成更短的推理过程。这与在推理时降低推理努力程度(reasoning effort)设置不同。根据 Fireworks 的发布帖子,Ember-1 以大约减少 40% 的 token 数量实现了 Kimi K3 的质量。
能,但只能通过 Fireworks 的无服务器 API 以研究预览(Research Preview)的形式使用。Fireworks 尚未发布 Ember-1 的权重、训练代码或确切的训练算法,因此目前无法自行托管。
Fireworks 团队报告称,像 Kimi K3 这样的推理模型有时会将超过 90% 的生成 token 用于内部推理。这在多轮 agent 工作负载中会造成成本叠加。每一轮都会将之前的推理过程回放给模型。上下文随着轮次数量近似呈二次方增长。早轮产生的长推理痕迹在每一轮后续调用中都会被重新读取,并重新计费。
Fireworks 团队解释了客户希望在更低成本下使用 K3 编程能力的诉求。调低 K3 的推理努力程度并不能解决这个问题。更低的努力设置会牺牲太多质量。因此团队转而训练模型更高效地进行推理。
K3 的推理并非全是冗余。其中一部分是有用的自我反思,比如重新审视某个假设或对反馈做出反应。Ember-1 保留了这些行为,同时削减了冗余推理和无productive循环。
训练数据集涵盖数学、编程、指令遵循、对话、搜索、工具使用和软件工程。它覆盖了独立问题和扩展的多步交互。任务和环境反馈指导着策略内的规划和学习。Fireworks 团队进行了超过 50 次训练实验和 200 多次评估。他们还开发了新的训练算法,但尚未公布。所有训练均在 Fireworks 无服务器训练平台上运行。Fireworks 表示使用了自有数据,未使用任何客户数据。
Fireworks 在三种推理努力级别下将 Ember-1 与 Kimi K3 进行了比较。成本按公开的 Kimi K3 API 定价计算。以下为 Fireworks 自身发布的评估结果。
| Benchmark | N | K3 Low | K3 High | K3 Max | Ember-1 | Ember-1 vs K3 Max (cost) |
|---|---|---|---|---|---|---|
| Terminal Bench 2.1 | 897 | 76.4% | 77.6% | 80.9% | 82.0% | -51.9% / -23.1 USD |
| SWE-bench Verified | 500 | 80.4% | 86.0% | 93.2% | 92.2% | -15.5% / -68.1 USD |
| SWE-Interact | 75 | 6.7% | 13.3% | 21.3% | 20.0% | -32.5% / -60.8 USD |
| DeepSWE 1.1 | 1135 | 55.8% | 62.8% | 66.4% | 75.2% | -23.7% / -126.9 USD |
| τ-2 Bench Airline | 50 | 64% | 64% | 64% | 66% | -5.9% / -0.3 USD |
Ember-1 在 Terminal Bench 2.1 和 DeepSWE 1.1 上领先 K3 Max。在 SWE-bench Verified 和 SWE-Interact 上略有落后。Fireworks 表示,在七项基准测试和两家客户的生成流量中,K3 的推理过程缩短了 35% 到 50%,且未牺牲准确率。
在 Doximity 的 Bedside Bench(一份由医师验证的 500 个临床病例集)上,Ember-1 创造了新的每任务成本-收益前沿。该结果来自 Fireworks 的新专业智能指数(Specialized Intelligence Index)。
Fireworks 在两家客户的生成编程工作负载上进行了实时 A/B 测试。两家客户在相当的质量下每个任务的 token 减少了约 35%。在发布的运行结果中,输出 token 从每个任务 49.3K 降至 29.9K。推理 token 下降了 71.3%,总 token 下降了 39%。任务分数基本不变:Ember-1 为 0.753,K3 为 0.751。平均步数从 23.8 降至 21.4。目前已有一家客户在生产环境中运行 Ember-1。
Ember-1 在 Fireworks 上的每 token 价格与 Kimi K3 相同:输入 3.00 美元,缓存输入 0.30 美元,输出 15.00 美元/百万 token。节省完全来自生成更少的 token。按该输出速率计算,A/B 数据的输出成本约为每任务 0.74 美元对比 0.45 美元(我们的计算,仅输出部分)。
Ember-1 是对 Kimi K3 进行后训练的产物,使其用更少的 token 进行推理,而非以更低的努力程度运行。
Fireworks 报告称在其各项评估中准确率保持不变的情况下 token 减少约 40%。
在生产环境 A/B 测试中,每个任务的输出从 49.3K token 降至 29.9K,分数为 0.753 对比 0.751。
在 Terminal Bench 2.1(82.0%)和 DeepSWE 1.1(75.2%)上超越 K3 Max,在 SWE-bench Verified(92.2%)上落后。
仅通过 API 提供的研究预览版,定价与 K3 相同;权重和训练代码未发布。
查看技术详情。所有功劳归该项目的研究人员。此外,欢迎在 Twitter 上关注我们,不要忘记加入我们的 15 万+ ML SubReddit 并订阅我们的通讯。你用电报吗?现在也可以加入我们了。
需要与我们合作推广您的 GitHub 仓库或 Hugging Face 页面或产品发布或网络研讨会等?请联系我们
Asif Razzaq 是 Marktechpost AI Media Inc. 的首席执行官。作为一位有远见的企业家和工程师,Asif 致力于利用人工智能的潜力为社会公益服务。他最近的举措是推出了一个人工智能媒体平台 Marktechpost,该平台以深度报道机器学习和深度学习新闻而著称,内容既有技术深度又易于广大读者理解。该平台的月浏览量超过 200 万次,在受众中广受欢迎。