Program-as-Weights 将 22MB 适配器编译进冻结的 0.6B Qwen3 解释器,在 MacBook M3 上以 30 tokens/s 达到 32B 模型的准确率,显存仅为后者的 1/50。
一个由 Program-as-Weights 编译的 0.6 B 解释器,在仅使用约五十分之一推理内存的情况下,于 MacBook M3 上以 30 tokens/s 的速度运行,即可达到与 32 B LLM 同等的准确率[1]。这一成果颠覆了长期以来「模型规模是通往高质量语言理解的唯一路径」这一信念,表明紧凑型适配器完全可以在资源消耗大幅降低的同时提供相同的性能。
在 PAW 出现之前,开发者将模糊函数任务——日志告警、畸形 JSON 修复、基于意图的排序——委托给远程 LLM API,因为没有任何本地方案能够接近它们的质量。虽然参数高效微调可以缩小模型体积,但要在基准测试中达到同等性能,通常仍需要大量资源,从而带来延迟和隐私方面的顾虑。
PAW 的编译器生成 22 MB 的适配器,插入到一个冻结的 0.6 B Qwen3 解释器中,而这套轻量级组合「在仅消耗约五十分之一内存的条件下,达到了直接提示 Qwen3-32B 的性能表现」[1]。这意味着生成的是一个可复用的产物,可以部署到边缘设备上,而无需牺牲以往只有巨型模型才能达到的基准级准确率。
在 FuzzyBench 套件上,同一个 0.6 B 参数的解释器达到了 73.78% 的精确匹配,超越了提示 Qwen3-32B 得到的 68.70%,且内存占用仅约 1.2 GB bf16,而大模型则需要 60 GB[1]。这几位数的提升说明,适配器不仅弥合了差距,在严格的内存预算下实际上还能改善任务特定性能。
该论文仅在模糊函数领域对 PAW 进行了评估,且依赖于冻结的解释器架构,因此类似提升能否迁移到通用生成或多模态任务,仍是未知数。此外,虽然 30 tokens/s 对于笔记本 CPU 来说已经相当可观,但仍然落后于高度优化的推理引擎,这意味着实时应用可能需要进一步的工程优化。
如果这些发现在更广泛的工作负载上得到验证,社区应当开始将 PAW 生成的适配器视为边缘友好型语言 AI 的新基准,并使用 0.6 B 技术栈重新运行 FuzzyBench 等基准测试,以取代当下实际运行的大型模型参考标准。
Program-as-Weights:模糊函数的一种编程范式