匿名模型 stealth/ox-alpha 悄然登录OpenRouter,上线即支持100万token上下文和视频输入,引发开发者社区对其归属和基准表现的广泛猜测。
一个免费的、匿名的神秘模型悄然上线 OpenRouter,在早期编程测试中超越了几个前沿模型,却没人确切知道是谁创造了它。在这个免费窗口关闭之前,以下是你需要了解的一切。
2026 年 8 月 20 日,一个新模型悄然出现在 OpenRouter 的目录中。没有发布公告,没有新闻稿,没有任何公司名称——只有一个写着"Stealth"的提供商标签和一个模型 ID:stealth/ox-alpha。
在 48 小时内,开发者们已经用它来处理真实的编程任务,拆解它的分词器,并将它的视频编码行为与已知模型进行对比,试图猜测它的来源。这就是我们现在的世界:前沿级模型有时不是通过主题演讲发布,而是带着一个耸肩和一个免费的 API 密钥登场。
以下是对 Ox Alpha 实际是什么、它能做什么、为什么社区认为它与某个中国实验室有关,以及目前流传的基准测试声明的全部解析。
Ox Alpha 被非正式地定位为一款面向编程、长时间运行的 Agent 工作流和生产使用的前沿级推理模型。目前它通过三个渠道可用:OpenRouter、OpenCode Zen 和 Mercury Cloud,并且已经被早期采用者(如 Nous Research 的 Hermes Agent 和 Zed 代码编辑器)作为可用模型选项纳入。
核心规格是上下文窗口:1,048,576 个 tokens,这与 Claude Opus 5、GPT-5.6 Sol、DeepSeek V4 Pro 和 Gemini 3.7 Flash 处于同一梯队——这些模型在 2026 年也都围绕一百万 tokens 的门槛。为了说明这意味着什么,一百万 tokens 大致相当于在单个请求中交给模型一个中等规模的完整代码库,或者几部完整的小说。
它还接受视频作为输入,这是大多数聚焦编程的模型不具备的能力。结合工具调用和结构化 JSON 输出,它可用于真正的生产工作流,而不仅仅是聊天。
被广泛传播的数字——最著名的是 DeepSWE 编程基准上 80% 的 Pass@1 分数——追溯到一位名叫 Ben Davis 的研究员进行的 10 项任务独立评估运行,而不是经过审计的排行榜。这个区别非常重要,所以值得精确地说明实际比较的是什么:
关键问题:DeepSWE 和 SWE-bench Verified 是不同难度配置的基准测试,所以 80% 的 DeepSWE 分数不能直接与 96% 的 SWE-bench Verified 分数进行比较——尽管新闻标题是这么写的。这也是一个小型样本(10 个任务),由一名独立测试者运行,而非受控的排行榜提交。把"超越 GPT-5.6 和 Claude"的说法当作一个初步信号,而不是经过验证的结果。
也就是说,同一测试中的一些具体数据点值得单独提出:
在一个名为"Meriyah Explicit Resource Declarations"的任务上,Ox Alpha 在第一次尝试就通过了,而 GLM-5、GPT-5.6 Sol 和 Grok 4.6 此前在该任务上的得分都是 0/4。
据报道,它在测试期间在 51,469 个回归测试中保持了干净的通过,没有引入副作用。
在一个有据可查的 69 次工具调用的 Agent 工作流中,它只犯了一个错误,没有重试循环——对于专门评估它用于自主 Agent 工作的任何人来说,这是一个不错的信号。
没有人正式认领 Ox Alpha。但独立研究员 Ben Davis 在 8 月 21 日发布了一份技术指纹分析,得出结论说他有 99% 的把握认为它是智谱 AI(Z.ai)未发布的 GLM-5.x 系列的一个变体。他的推理基于四个主要支柱:
视频编码器行为。在四个受控视频测试集上,Ox Alpha 的 token 消耗、独立于帧率的采样、持续时间缩放(约 147 tokens/秒视频)和每帧分辨率缩放都与 GLM-5V-Turbo 几乎完全匹配。MiMo v2.5、Qwen 3.8 Max 和 GLM-4.6V 等候选模型都显示出明显不同的编码行为。
分词器对齐。在 25 个测试提示中,Ox Alpha 的 token 计数与 GLM-5.3 完全匹配,只有一个固定的 +75 token 包装器偏移——这是共享词汇表的有力迹象。
音频拒绝模式。Ox Alpha 拒绝音频输入的方式与 GLM-5V 相同,这也排除了 MiMo v2.5 作为候选,因为该模型确实支持音频。
输出风格。Ox Alpha 每 1000 个字符的输出使用约 1.3 个 emoji,与 GLM/Qwen 家族的风格一致。在 Davis 的同一测试条件下,Claude、GPT-5.6 和 Grok 都显示出接近零的 emoji 使用率。
被其分析排除的组织及其原因:小米(视频/音频不匹配)、DeepSeek(没有先前的视频能力,分词器不同)、Google、阿里巴巴、xAI、OpenAI 和 Anthropic(在分词器、输出风格或架构方面整体不匹配)。
值得注意:这是行为指纹推理,不是确认的消息来源。这是令人信服的间接证据,不是认领声明。
在正式公告之前在路由平台上测试匿名的"神秘"模型已经成为一个可识别的模式,尤其是在中国实验室中。根据平台 OrcaRouter 的追踪,在过去六个月中已经有其他四个神秘模型出现并随后被正式认领:
时间线与智谱自身的近期动作一致:该公司于 2026 年 8 月 14 日发布了 GLM-5.3 作为纯文本模型,表示模型权重在安全审查完成前(约两周后)不可下载。Ox Alpha 在六天后出现,已经携带了 GLM-5.3 没有附带的 multimodal(文本、图像、视频)能力——这符合这是一个未发布的统一 GLM 视觉旗舰版预览的理论。
如果你正在评估 Ox Alpha 用于实际工作,以下是一个接地气的思考方式:
适合的场景:实验超长上下文工作流(整库分析、大型文档审查)、工具调用可靠性重要的 Agent 编程任务,以及任何受益于代码与视觉上下文结合的工作流(截图、UI mockup、视频演示)。
要有准备的:没有官方文档、没有支持渠道、没有 SLA,而且免费窗口确实是临时的。也没有确认的预览后定价,所以不要构建任何你无法快速替换的东西。
不要过度依赖基准测试标题。80% 的 DeepSWE 数字是真实的,但它是针对一个不同基准的小型独立运行样本,与前沿模型报告的 96%+ 的 SWE-bench Verified 分数不同。在得出结论之前,在你自己的任务上运行你自己的测试。
Ox Alpha 是一个真正有趣的案例研究,展示了前沿 AI 实验室如何越来越多地使用匿名、免费的预览发布来收集真实的生产使用数据,然后才正式发布——这是一种"通过分发测试"的策略,让实验室能够在不承诺名称或价格的情况下验证基础设施并收集反馈。无论智谱最终是否确认它是 GLM-5.x,自身的模式(四 个先前的神秘模型,最后都被中国实验室认领)表明它不会保持匿名太久。
如果你是一个喜欢在新模型出现时立即尝试的开发者——就像我们中的许多人已经在 OpenRouter 列表中的 GLM、Kimi 和其他任何新事物之间轮换一样——这值得在免费窗口在 8 月 27 日左右关闭之前花 15 分钟尝试。只是不要在一个还没有名称的模型上构建生产基础设施。
要尝试的模型 ID:OpenRouter 上的 stealth/ox-alpha。
本文是基于 2026 年 8 月 22 日至 23 日的公开报道和独立测试的快照。对智谱 AI/GLM-5.x 的归属未经官方确认,定价、可用性和基准排名在此类发布中可能会快速变化——在将其用于生产决策之前,请验证 OpenRouter 上的实时列表。