神秘的 Hy3 模型在 OpenRouter 基准测试中超越主流 LLM。程序员可以尝试这个新选项用于代码生成和推理任务。
OpenRouter 是一项通过统一 API 提供绝大多数 LLM 访问能力的服务。考虑到最近新 LLM 的发布节奏极快,这项服务变得格外实用。由于该公司处在用户与各家 LLM API 之间,OpenRouter 掌握了稳健且具有代表性的数据,能够反映用户如何与 LLM 交互,并将这些数据发布在 AI Model Rankings 页面上。这与各家实验室的做法形成了令人欣慰的反差——出于竞争方面的考虑,它们通常会对这类数据保密。最近,我查看 OpenRouter 排名时,注意到了一件不同寻常的事。
现在有两个新模型的 token 使用量超过了 LLM 宠儿 Claude,而且领先幅度超过 50%?DeepSeek Flash V4 我倒是听说过:它是 DeepSeek 发布的一款开源模型,不仅速度快、价格低,性能也以极低的成本逼近头部 LLM,因此它广受欢迎并不奇怪。但 Hy3 preview 到底是什么鬼?我从没听说过 Hy3,也没见有人讨论它。Google 搜索后,只能找到中国科技巨头腾讯发布的一则 Hy3 开源公告;Hugging Face 上的模型页面本身内容很少,而且还列出了一些诚实得有些反常的 benchmark 结果——与其他中国开源模型相比,这些结果对 Hy3 并不有利。
在 Hacker News 上搜索 Hy3,只能找到一条与 Hy3 本身无关的投稿;Reddit 上的讨论则更多集中在它的开放权重版本上。有一个 Reddit 帖子也注意到了 Hy3 的崛起,但那是在 5 月 6 日,当时 OpenRouter 免费提供 Hy3。如今这个免费 endpoint 已经不存在,因此 Hy3 在上述周榜中的使用量来自付费用户。
显然,Hy3 preview 在 Agent 编程之外的领域也很受欢迎。
是我错过了什么吗?经过一些不太科学的测试,我发现这个模型的质量确实与前面提到的其他中国模型处于同一水平,但离 Claude Opus 4.7 和 GPT 5.5 之类的模型还差得很远。它并不是什么被人忽视、埋在沙砾中的神奇钻石,所以背后一定还有其他原因。幸运的是,OpenRouter 掌握的数据可以帮助缩小可能原因的范围,但检查完这些数据后,我反而更加困惑了。
根据 OpenRouter API 标明的价格,Hy3 preview 的输入价格是每 100 万 token 0.066 美元,确实低于当前排名第一的 DeepSeek V4 Flash——后者标明的输入价格是每 100 万 token 0.10 美元。考虑到 LLM 和 Coding Agent 的成本正在急剧上升,更便宜的模型胜出是说得通的,但前提是它能提供相近的质量,而 Hy3 preview 似乎并没有做到这一点。
下面是模型页面上 OpenRouter 提供的 Hy3 preview 使用量变化图:
Hy3 preview 在 5 月 8 日之前没有任何使用数据,这意味着模型大概是在那时从免费 SKU 切换到了付费 SKU。此后的使用量一直保持稳定,而本文开头展示的排名已经是模型发布数周后的结果。这说明它的使用量至少是自然产生的——或者说,伪造这些使用量的成本会非常高——而不是一次性的异常值。值得注意的是,如果根据这里展示的数据进行计算,目前 LLM API 调用中输入 token 与输出 token 的总体占比已经达到 98% 对 2%。
在 OpenRouter AI Model Rankings 的历史上,某些特定 App 将默认模型切换为某款 LLM 后,确实曾造成使用量突然飙升。例如,2025 年 9 月 Kilo Code 免费提供 Grok Code Fast 1 后,它的受欢迎程度便迅速蹿升。但 Hy3 preview 似乎不是这种情况,因为 App 只占其活动量中非常小的一部分。
OpenRouter 的核心价值主张,是能够把给定的 API 请求自动路由到不同 Provider。对于 DeepSeek V4 Flash 这样的开放权重模型,OpenRouter 列出了 13 家 Provider;但尽管 Hy3 preview 同样开放了权重,它却只有一家 Provider¹:位于新加坡的 SiliconFlow。SiliconFlow 在 OpenRouter 上的使用量页面显示,它此前的使用量相对较少……直到 Hy3 出现。
巧合的是,这个数据可视化还显示,当 Hy3 preview 从免费转为付费时,其使用量并没有大幅下降。这件事本身就很有意思:如果用户无法从这个免费模型中获得价值,那么一旦费用开始从他们的钱包里扣除,他们很可能就会停止使用。
我到底漏掉了什么?是我想得太复杂了吗?答案真的只是“它最便宜”,再加上免费期间通过亏本引流积累了足够的用户势能?
……但 Hy3 preview 真的是 OpenRouter 上由大公司支持的最便宜 LLM 吗?在反复检查一些假设时,我发现 OpenRouter 的数据显示,Hy3 preview 并不是当前最便宜且表现良好的 LLM。真正的答案其实是 DeepSeek V4 Flash,只不过其中有一些有趣的附加条件。
下面再补充几条很少有人讨论的 LLM API 运作机制。LLM 调用目前仍然是无状态的,这意味着每一轮交互之后——包括用户向 LLM 提问的消息——当前对话线程中的所有 token 都要重新处理。对于 Agent 而言,这意味着输入 token 的数量会随着每条新消息不断累积。这也是为什么为了更有效地使用 Agent,通常建议在上下文逐渐填满时频繁开启新线程。
不过,即使在 Agent 工作流出现之前,完整 PDF 等大型输入也会以类似方式使上下文膨胀。因此,大多数 LLM Provider 都实现了 prompt caching,用来复用对话中此前已经处理过的输入 token。这是一种双赢机制:LLM Provider 可以节省时间和算力,并将节省下来的成本让利给客户。大多数 LLM Provider 都会自动缓存输入,通过 OpenRouter 访问时也包括在内。费用旁边的“磁盘加闪电”图标表示 token 已被缓存。不过,缓存不一定每次都能命中,尤其是 OpenRouter 在同一线程中途切换 Provider 时。一个另类是 Anthropic(Claude)API:出于某种原因,它要求你先为 cache write 付费。
通常,cache read 的费用是输入费用的 10%。OpenAI API、Anthropic API 和 Google Gemini API 的最新模型都是如此。对于提供 DeepSeek V4 Flash 的 13 家 Provider,cache read 费用介于输入费用的 20% 到 50% 之间。这也说得通,因为它们可能不具备同等的规模经济优势。不过,其中一家 DeepSeek V4 Flash Provider 是个例外:
它的 cache read 费用只有 2%!(乘以 2,再把小数点向左移动两位。)DeepSeek 的 cache read 价格为什么能这么低?从 V4 开始,DeepSeek 实现了一种新的 KV caching 方法。作为模型的创造者,它最有条件充分利用自己的创新;正如前面提到的,这些创新带来的收益最终会传递给客户。由 DeepSeek 自己提供服务时,DeepSeek V4 Pro 变体模型的 cache read 费用甚至只有 0.83%!(这次最好用计算器算一下。)
还记得我前面展示的数据吗?如今 LLM API 成本中有 98% 来自输入 token,而这些 token 会被大量缓存。这意味着 LLM 所“标明”的价格现在具有误导性;但不同寻常的是,这种误导对客户反而有利,因为实际价格会便宜得多!为了消除这种模糊性,OpenRouter 现在会在模型页面上提供实际价格表,把 cache hit 带来的成本节省也计算在内。下面是通过 OpenRouter 使用 DeepSeek V4 Flash 时,不同 Provider 对应的实际价格。由于各家 Provider 的 cache read 费用和 cache hit rate 不同,实际价格也各不相同:
这些价格差异巨大,但请注意第二行:Provider 是 DeepSeek 自己,其输入 token 的价格低至惊人的每 100 万 token 0.018 美元!2% 的 cache read 费用确实效果显著。如果与 Hy3 preview 进行同口径比较,根据其模型页面上的数据,SiliconFlow 提供的 Hy3 preview——cache read 费用高达惊人的 44%——实际价格是每 100 万 token 0.034 美元,几乎是 DeepSeek 自己提供的 DeepSeek V4 Flash 的两倍!当然,这只适用于明确选择 DeepSeek 作为 Provider 的情况,而部分下游 OpenRouter 客户端或 Agent 可能不支持这样做。OpenRouter 上的价格与 DeepSeek 直接提供的价格一致,因此直接使用 DeepSeek API key 也能得到相同效果。
这里还有一个无法回避的问题:DeepSeek 是一家中国公司。有些人可能不愿意——或者在法律上不能——把自己的支付信息或 LLM 输入数据交给一家中国公司。况且,根据 OpenRouter 的数据政策信息,DeepSeek 将 prompt training 设置为了 true。这确实是一个合理的担忧。
没错,如果你能稳定用完使用额度,那么 Claude Code 和 Codex 这类订阅制 LLM 服务仍然最物有所值。但通过 API 使用价格极低的 DeepSeek V4 Flash,并不会把你锁定在订阅中。如果你只需要再补充一点 Agent 算力来完成某个项目,它比为订阅服务的额外用量付费更便宜。² 至少,它能在微观经济层面对更多定价花招形成制约。随着 Agent AI 竞争升温,这类定价操作很可能会贯穿整个 2026 年。
总的来说,我依然无法理解 Hy3 preview 为何会在 OpenRouter 上如此受欢迎。根据现有数据和上述分析,我的猜测是:确实有一个与腾讯无关的大型 App,正在使用 Hy3 作为其数据处理骨干,而且这个 App 并不只是一款 Agent 编程应用。但 OpenRouter 的一项优势,就是切换模型和 Provider 的成本很低。如果几周后大家逐渐意识到 DeepSeek V4 Flash 的价格优势,进而导致其使用量暴涨,我一点也不会感到惊讶。
Hy3 的许可证限制非常严格,可能会阻止 Provider 采用这个模型。↩︎
Hy3 的许可证限制非常严格,可能会阻止 Provider 采用这个模型。↩︎
DeepSeek 最近还发布了自己的 V4 Flash Coding Agent 平台,并声称会利用其强大的缓存能力。不过,该平台的输入价格虽然只有标准输入费用的 50%,cache read 费用却高达 20%,明显贵了许多。因此,它在经济性上是否真的比使用 DeepSeek API key 搭配其他 Agent 更便宜,目前还不明确。↩︎
DeepSeek 最近还发布了自己的 V4 Flash Coding Agent 平台,并声称会利用其强大的缓存能力。不过,该平台的输入价格虽然只有标准输入费用的 50%,cache read 费用却高达 20%,明显贵了许多。因此,它在经济性上是否真的比使用 DeepSeek API key 搭配其他 Agent 更便宜,目前还不明确。↩︎