Hetzner 推出 LLM 推理服务
云基础设施商推出 LLM 推理产品,为开发者提供低成本的模型部署新选项。
云基础设施商推出 LLM 推理产品,为开发者提供低成本的模型部署新选项。
Hetzner 正在试验 LLM inference。
这句话原本不在我的预期之中,但我觉得这件事非常有意思 :)
在有人把生产环境中的 AI 工作负载迁移到 Hetzner 之前,必须先说明:这目前完完全全只是一个实验。没有计费机制,没有 SLA,没有生产环境保障,而且目前只有一个模型。Hetzner 表示,他们希望了解用户是否真的需要这项服务、系统如何扩展、哪些功能最重要,以及它能承受多大的负载。
所以,这并不是一次成熟产品的正式发布。Hetzner 只是把一个早期版本摆到用户面前,看看接下来会发生什么。我非常喜欢这种做法。
Hetzner Inference 是一个运行在 Hetzner 自有基础设施上的 OpenAI-compatible API。你可以在 Experiments 控制台中创建 API token,把 OpenAI client 指向 Hetzner 的 base URL,然后像使用大多数其他 inference API 一样使用它。
目前唯一可用的模型是 Qwen/Qwen3.6-35B-A3B-FP8。它是一个拥有 350 亿参数、激活参数为 30 亿的 Mixture-of-Experts 模型。它支持文本和图像输入,拥有 262K context window,并使用 FP8 量化权重。
对于一个实验来说,这是个相当合理的模型。它足够小,不需要荒唐庞大的 GPU 集群就能提供服务;同时也足够实用,可以使用真实工作负载来测试 API。
如果你想在不编写任何代码的情况下试用它,Hetzner 还发布了一篇简短教程,介绍如何将 OpenCode 连接到该 API。
由于这个 API 与 OpenAI 兼容,集成过程几乎没有什么特别之处:
pip install openai
from openai import OpenAI
client = OpenAI(
base_url="https://inference.hetzner.com/api/v1",
api_key="YOUR_TOKEN",
)
response = client.chat.completions.create(
model="Qwen/Qwen3.6-35B-A3B-FP8",
messages=[
{"role": "user", "content": "Explain why the sky is blue in one sentence."}
],
extra_body={
"chat_template_kwargs": {
"enable_thinking": False,
}
},
)
print(response.choices[0].message.content)
enable_thinking 这个选项值得单独一提。如果不设置它,模型可能会在返回用户可见的答案之前,把多得惊人的 completion budget 消耗在推理上。这个选项在我的测试中有效,但 Hetzner 并没有对其进行文档说明,因此目前我不会围绕这种具体的请求结构构建任何重要功能。
我在 2026 年 7 月 23 日做了几项小规模测试。我不打算把这篇文章变成一份庞大的 benchmark 报告,因为这个产品仍处于实验阶段,针对它做的 benchmark 很可能很快就会过时。不过,粗略数据如下:
这很快!但这也只是某个时间点、来自一个 client 的一次测试。它不是 SLA,也几乎无法说明很多人同时使用这项服务时会发生什么。
模型本身的表现大致符合我的预期。它能够遵循大多数格式和检索指令,正确处理了一张图像,但答错了两道非常简单的算术题。所以:一个小型、略显垃圾的 LLM :D
Qwen endpoint 很好玩,但我认为当前使用的模型并不是最有意思的部分。
真正有意思的是,Hetzner 为什么要试验 inference。
从这里开始,全部内容都只是我的个人推测。我没有任何内部消息,Hetzner 也没有人告诉过我他们正在制定什么计划。我只是观察这个产品,并尝试把一些线索串联起来。
开放权重模型的 inference 是一个商品化市场。每个人都可以下载同样的权重,运行大同小异的 serving software,然后暴露一个 OpenAI-compatible API。切换提供商也很容易,尤其是有 OpenRouter 这类产品;对于自托管场景,也可以使用 LiteLLM。
这意味着,除非你拥有某种优势,否则很难获得巨额利润。通常,这种优势意味着:
Hetzner 非常擅长采购硬件、把它们部署到自己的数据中心,并以极其高效的成本结构进行运营。这基本上就是这家公司的全部业务。如果有人能把 inference 变成又一种低利润率的基础设施产品,那么 Hetzner 至少是一个可信的候选者。
这里还有一个很漂亮的利用率逻辑。一台出租的 bare-metal GPU 只属于一位客户,无论这位客户是否真正使用它。Inference API 则可以在许多用户之间共享 GPU 容量,让硬件始终保持忙碌。如果 Hetzner 拥有闲置的 GPU 容量——或者正计划建设规模大得多的 GPU 集群——那么 inference 产品就可以帮助它把这些容量转化为收入。
再次强调,我不知道他们实际做的是不是这件事。只是从我的角度来看,这在经济上说得通。
这正是我目前还没有被说服的地方。
Hetzner 目前公开提供的 dedicated GPU server 产品线使用两种 GPU:
这些 GPU 的性能很强,而配备 96 GB VRAM 的 RTX PRO 6000 对于中小型模型来说,是一台相当不错的 inference 机器。Hetzner 当前 Qwen 模型的 FP8 文件大约为 38 GB;根据 context length、cache size 和 serving setup 的不同,实际 VRAM 占用还会更高一些。
但这些都是工作站 GPU,并不是运行真正超大型开放模型所需要的高密度多 GPU 系统。
以 GLM-5 这个极端案例为例。它拥有 7540 亿参数,官方 serving recipe 会把模型拆分到 8 块 GPU 上。即使采用激进的量化方案,所需 VRAM 仍然会达到数百 GB。现实地说,这需要 B200/B300 级别的硬件,或者类似的方案,并且多块 GPU 之间还需要非常高速的互连。
Hetzner 目前公开的 bare-metal 产品线并不提供这类硬件。
当然,这并不能说明实验性 API 背后运行的是什么。Hetzner 可能使用了完全不同的内部硬件,而且公开的 inference 产品也不必照搬其 dedicated-server 产品目录。
不过,这正是我正在关注的部分。
如果 Hetzner 继续只提供一两个较小的模型,我不太认为它会成为一家重要的 inference 提供商。那会是一个很酷的实验,但也仅此而已。
如果这个实验只是迈向更大规模 GPU 集群、完善的模型目录以及 B200/B300 级硬件的第一步,那么事情就会变得有趣得多。Hetzner 已经拥有数据中心、网络、硬件经验、欧洲市场定位,以及以激进定价著称的声誉。这些优势结合起来,可能让它成为一个强有力的竞争者。
就目前而言,这个 API 速度很快、免费,而且值得一试。对我来说,真正有意思的问题并不是他们接下来会增加哪个小模型,而是 Hetzner 是否会投资部署大型模型所需的硬件。