基于Qwen3.6-35B微调的35B参数编程模型,SWEBench得分69.4,FP8量化后仅21GB,单张RTX 3060即可运行,但"开放"程度与需要数据中心的Kimi K3截然不同。
2026 年 7 月 23 日,拥有 4.08 亿日活用户的中国短视频巨头快手,静悄悄地在 Hugging Face 上传了一个 350 亿参数的编程模型。几小时内,社区就把它量化成了 21GB。几天内,开发者们已经在 RTX 3060 显卡上运行它了。
模型卡片上标注的 SWE-bench Verified 分数是 69.4。这个数字让它在同量级的所有开源模型中名列前茅,包括它基于的 Qwen 基座。但真实的故事不是这个分数本身,而是那张榜单。
KAT-Coder V2.5 上线三天后,月之暗面发布了 Kimi K3——1.5TB 的权重,分布在 96 个分片上。需要一排数据中心级 GPU 才能加载它。两者都被称为"开源"。两者表达的意思完全不同。
KAT-Coder V2.5 可以装在一张显卡上。Kimi K3 不行。这两者的许可证都声称服务于开发者,但其中只有一个是开发者真正能运行的。
KAT-Coder V2.5 不是从零训练的。它基于阿里云的 Qwen3.6-35B-A3B——已经有成千上万人在本地运行的同款基座——然后在强化学习开始前,先叠加了 127,000 条监督样本。架构是公开的。任何人都可以下载。
真正的故事是他们用什么数据来训练的。
KuaiPilot 的训练流水线对每个任务要求三样东西:需要修复内容的精确描述、一个真正能构建和运行的代码仓库,以及一组判定修复是否有效的测试。一个补丁只有在通过全部三项时才算有效。构建 100,000 个这样的环境是一个基础设施问题——因为互联网上大多数代码仓库在一台陌生的机器上并不能干净地构建。
所以他们构建了 AutoBuilder——两个 Agent 形成循环。一个负责编写安装和测试脚本,另一个在沙箱中运行它们并报告哪里出错。一开始,AutoBuilder 能重建 16.5% 的代码仓库。到最后,它能重建 57.2%。这让他们在 12 种语言中跨越了 100,000 个可验证环境的门槛:Python、JavaScript、TypeScript、Java、Go、C++、Rust 等等。
这是大多数博文都会跳过的部分。大约 16% 的运行中,模型因为沙箱的错误而受到惩罚,而不是模型本身。错误的 reward,错误的反馈——模型学会规避从未犯过的错误。KuaiPilot 把这个错误率压到了 2% 以下。
一个损坏的评判器会让训练变成主动伤害。
他们在第二个地方做了同样的修复。在 RL 期间,模型在探索时生成的 token 与后来训练的 token 可能产生漂移。KuaiPilot 强制它们保持一致,让反馈与它所来自的尝试相匹配。
经过 10 轮 RL 训练,并对病态行为——单轮 70+ 次工具调用、空工具块、自我重复——施加明确惩罚后,错误标注的工具调用从 9.34% 降到了 0.28%。单轮重复降到了零。
然后是成绩单:SWE-bench Verified 69.4,多语言集 63,SWE-bench Pro 45.96。
一个名为 Spacebike 的用户在模型页面的讨论区 #12 中贴出了另一列数字。阿里云自己发布的同款 Qwen 基座分数不是 64.4——而是 73.4。DeepReinforce 自己发布的 Ornith 1.0 35B 分数不是 55.8——而是 75.6。
任何一方都没有捏造数字。他们只是在运行不同的评测框架。各团队都在为自己的评测设置做调优。
KuaiPilot 在同一配置下重新运行了每个模型,并在脚注中公布了精确的 agent、temperature 和上下文设置。他们也坦承了大多数实验室略去的事实:面对如此多的候选检查点,每个基准测试跑五次重复运行是不可承受的。所以图表上的每个数字都是单次通过。
他们的辩护是:七个基准测试联动变化是很难用采样运气来伪造的。证据就在他们自己的模型卡片上。Terminal-Bench 给这个模型 41.02——一个平均分。在一种 agent 框架下,同一个模型得分 32.6。换一种框架,得分 49.4。
相同的权重。相同的任务。差了 17 分。
Terminal-Bench 2.1 的存在,是因为 v2 版本中 89 个任务里有 28 个是损坏的。这大致就是 2026 年开源模型基准测试的现状。你看到的每个分数都是一个数字加上一套评测框架——而评测框架通常是截图里被裁掉的那部分。
图表是一份声明,不是证据。Hugging Face 上的讨论帖有真正的答案。
一位测试者在 100 万 token 的工作上下文上运行它,报告说 yarn scaling 全程保持稳定,而他在对比的模型在 32K–64K 之后就失去方向,工具调用也跟着崩溃了。
另一位测试者在 RTX 3060 上用量化版本运行一个包含 100+ 文件、50,000 行代码的真实项目,把它与一张比手机还便宜的显卡上运行的 270 亿参数模型进行了比较,结果大致持平。
最常被重复提到的观察是关于思考 token 的。它比它基于的基座模型花费的思考 token 更少,而且 trace 读起来像推理而不是絮叨。对于一个按 token 计费的模型来说,这本身就是大部分价值所在。
它可以通过 Transformers、vLLM、SGLang、KTransformers 或 llama.cpp 来运行。文档中有一个陷阱:开源版本只有文本,所以 vLLM 需要一个 language-model-only 标志,否则它会尝试启动一个不存在的视觉塔。
Terminal-Bench 2.1 给它 41.02。那张榜单上最好的系统接近 89.5。在截至 8 月 2 日的开源权重排行榜上,Ornith 1.0 396B 得分 82.4,DeepSeek V4 Pro 80.6,MiniMax M3 80.5,Kimi K2 80.2,Claude Opus 5 96。
KAT-Coder V2.5 落后前沿 27 分,落后已发布的最强开源权重 13 分。它真正击败的是每一个你能放在已有硬件上的开源模型。这个声明比图表上的要小得多——但也管用得多。
下载量数据表明人们自己在权衡。官方仓库一个月内大约移动了 13,000 份。一个社区 4-bit 转换版本移动了 96,000 份——是那个能装进显卡版本的七倍流量。
如果你宁愿租用而不是运行,关系最近的同类模型在 OpenRouter 上有。Air 版每百万 token 输入 15 美分、输出 60 美分。Pro 版每百万 token 输入 74 美分、输出 296 美分。
头条分数是这个发布中最不有趣的东西。
一个团队在寻找为什么他们的模型不断被惩罚时,发现了自己在六分之一的运行中评判器出了问题,并在触碰模型之前修复了这些。这是从扩大算力到扩大正确性的区别。
在短短一周内,"开源"有了两个含义:一个是你桌上的 21GB,另一个是别人机架里的 1.5TB。只有其中一个真正属于你。
Shakti Tiwari NIFTY Options Trader | optiontradingwithai.in 构建有效的系统性交易 + AI 系统
Tags: #ArtificialIntelligence #OpenSource #LLM #MachineLearning #CodingAgents #LocalAI #Qwen #KAT-Coder #SoftwareEngineering #Benchmarking