当前 Token 价格受大厂补贴,人为压低;一旦融资烧钱结束、厂商回归正常商业模型,Token 费用大概率上涨,自托管可规避风险。
我不知道一个 token 的真正成本是多少。它们由大型科技公司补贴,大多数 AI 提供商都在亏损运营。一旦资金枯竭,供应商不得不像正常企业一样运营,token 的成本就很可能会上涨,就像最近已经发生的那样。就连微软也发现 Claude Code 太贵了,尽管开发者们普遍更喜欢它而不是 GitHub Copilot,但微软还是取消了其许可证。

大多数组织正在让自己的业务逻辑依赖 LLM。你不会仅仅因为成本上涨 10% 就停用生产环境中的聊天客服 Agent。但如果价格上涨 10% 发生三四次,你就需要仔细审视财务状况了。
由于工具调用、检索、推理,以及 Agent 决定写一个完整的网页而不是用纯文本回复等原因,Agent 逻辑也越来越 token 密集。
你有两个选择
如果你想继续使用前沿模型,优化 token 使用
我主张第二个选择。Mitko Vasilev 的 tagline 把道理说得很清楚
确保你拥有自己的 AI。云端 AI 与你不是对齐的;它与拥有它的公司对齐。
n8n 在这方面领先了一步,主要有两个原因。两年前推出的自托管 AI 入门套件(!!!),以及工作流中作为核心功能可交换的 AI 组件。你可以在不重写围绕这些组件的工作流逻辑的情况下切换模型提供商。

不,但被低估的开源社区构建了多个 LLM,可以帮你降低成本。
除了不把你的支出决策外包给第三方提供商,自托管 LLM 还有一些优势:
更少的故障点:2026 年,Claude 频繁宕机(撰写本文时正常运行时间仅 98.64%),而你对此无能为力。行业标准的计算服务有五个九的正常运行时间,即 99.999%。除了依赖 LLM 提供商的可用性外,还有相关的网络依赖问题,你可能会遇到超时或速率限制。
额外的控制能力 —— 当你拥有模型端点时,你可以决定每一层发生什么。你控制运行的是哪个模型版本以及何时更新,或者是否更新。你不受 LLM 提供商通过 API 暴露的控制项限制。
隐私 —— 提示词和输出都不会离开自托管环境,除非明确导出。不存在数据子处理器或第三方提供商更改其数据处理条款的问题。
可解释性 —— 有一些工具如 TransformerLens 或 SAEs 可以帮助你更好地理解 LLM 的内部运作,而这在使用云模型时是无法实现的。
模型定制和微调 —— QLora 和类似技术允许将模型定制到可以完成特定任务的程度,在特定领域,小型模型可以达到与 SOTA 模型相同的性能,但体积和时间成本只是很小的一部分。随着 OpenAI 废弃了他们的微调 API,这一点变得更加重要。
当服务宕机时,你不能指责 OpenAI 或 Anthropic,所以你必须承担模型基础设施带来的所有责任。有一些需要注意的地方:
供应链安全:选择、部署和管理模型是你的责任,这意味着你要承担拉取带后门模型的风险。运行时也有一套自己的漏洞。
设置和配置:你不能靠感觉代码来部署基础设施。例如,虽然 AI 入门套件使其易于启动,但如果你想超越 Ollama 或想让 LLM 暴露给非 n8n 服务,你就需要设置基础设施。自托管在本地机器上、在组织硬件上、或使用云提供商提供计算,方式各不相同。
管理破坏性变更。更新任何组件都可能使其无法工作。破坏性变更的示例见此处。
性能 —— 前沿模型是当今性能最好的模型。新的模型发布迄今为止总是在基准测试中胜过旧模型。
资源利用 —— LLM 在模型和缓存之间消耗大量内存,可能导致内存不足错误,这可能会杀死共享计算层(没有隔离)的 Agent 和其他进程。
假设你正在编写 Agent 并使用 n8n 暴露它们,你将管理的层包括基础设施(和操作系统)、模型运行时,以及模型。
自托管并不意味着你必须在本地机器上运行,等六个月拿到 H100,然后在办公室找个壁橱空间,或者去 Equinix 租用几个机架。你仍然可以租用计算和存储,按你自己的方式在云基础设施上部署 LLM。
对于基于 GPU 的 IaaS,你可以从以下非穷尽列表中选择:
RunPod 提供 GPU Pod(持久化虚拟机)和 Serverless(按秒计费的推理端点),覆盖从开发到生产部署的完整范围。
Lambda Labs 是稳定专用实例的首选,没有数据出口费 —— 如果你的工作流向本地 n8n 实例推送大量补全内容,这是一个显著优势。
CoreWeave 提供为企业级基础设施,优化用于大型多节点集群。H100 按需运行约 4.76 美元/小时,承诺容量有批量折扣。
Vast.ai 提供最低标称价格,旧款 GPU 约 0.17 美元/小时起,通过点对点市场。
大型云服务商 也是一个很好的选择。如果你已经在大型云上运行 n8n,你可以探索在你现有的环境中托管 LLM。例如,AWS 同时提供 CPU 和 GPU 用于 EC2。
是的,你本质上只是把支出从一个提供商转移到另一个提供商,并承担运营负担,但请记住前提 —— token 价格是任意的。Token 没有市场价值,所以它们很容易暴涨。而基础设施即服务另一方面是一个竞争激烈且成熟的领域。如果 GPU 租用的风险太大,你总是可以选择在 CPU 上运行 LLM。
运行时为服务 LLM 有不同的机制,最显著的是它们在 CPU 还是 GPU 上运行。其他考虑因素包括模型格式(如 GGUF 或 safetensor),以及新模型是否会在所有现有运行时上得到支持。Ollama 是一个你可以入门的通用运行时。
llama.cpp 同时支持基于 CPU 和 GPU 的架构,但一直是基于 CPU 用例的首选。它是一个高度可移植的参考运行时。它支持 AVX2、AVX-512 和 ARM NEON 指令集,零 GPU 依赖运行,是 Ollama 在底层使用的引擎。它是开发环境和低流量部署的正确选择。
vLLM 是生产级、GPU 优化的服务器。它实现了连续批处理和 PagedAttention,当多个 n8n worker 同时触发 AI Agent 节点且你需要 GPU 高效处理并发请求而不是串行化时,它是一个很好的选择。
Ollama 是对开发者友好的入口点。它在简洁的 API 背后封装了 llama.cpp,处理模型生命周期管理,是 n8n 自托管 AI 入门套件的默认目标。它以一定的性能上限换取显著降低的运营摩擦。
LM Studio 为运行本地模型提供桌面 GUI。对于想要在无终端情况下进行实验的内部团队很有用,但不是为无头服务器部署设计的。
SGLang 为结构化和约束生成而优化。当 n8n 工具调用节点需要模型返回有效 JSON 时,它特别相关 —— 与通用推理服务器相比,这类失败比应有的情况更常见。
ExLlamaV3 在 NVIDIA 硬件上的量化效率比大多数替代方案更进一步。它的主要价值是将更大的模型放入有限的 VRAM 预算中。
高参数模型的行为会更像 Anthropic 和 OpenAI 提供的基础模型,但资源消耗量大。大多数组织在配备 3B–13B 参数范围模型(Q4 量化)的通用硬件上自托管时,可以在性能和资源消耗之间取得良好平衡。这个范围的模型可以在单个消费级 GPU(或有能力的 CPU 服务器)上运行,产生足够满足大多数业务自动化任务质量的输出,并且上下文处理时间足够短,在交互式工作流中可行。
除了文本生成本身,模型大小对函数或工具调用的质量也有影响,这在此处进行了评估。
Llama (Meta) (1B-70B) 是参考的开源权重模型系列。Llama 3.x 模型是强大的通用选择,受到堆栈中每个运行时的良好支持,并在允许大多数组织商业使用的许可证下提供。8B 和 70B 变体是部署最广泛的。
Qwen (Alibaba) (0.8B – 72B) 在代码生成和多语言任务方面特别强。Qwen2.5-Coder 变体在与工具调用 Agent 配合使用时,与更大的通用模型相比具有竞争力,而 Qwen3.5 系列将范围扩展到适合路由和分类任务的亚 1B 模型。
Mistral (7B – 22B) 在 7B–22B 范围内提供高效的中型模型。当 GPU VRAM 受到限制且需要无需动用 70B 就能获得一个有能力的通用模型时,Mistral Nemo 和 Mixtral(混合专家架构)是很好的默认选择。
Google Gemma 3 / Gemma 4 (2B – 27B) —— 最小的 Gemma 4 变体(2B 和 4B 有效参数)在现代硬件上以 4 位量化运行约 5 GB RAM。Apache 2.0 许可证使商业部署 straightforward。
Qwen 3.5 Small (0.8B–9B) —— Qwen3.5 系列跨度从 0.8B 到 9B 参数,256K 上下文窗口,支持 201 种语言。它提供思考和非思考模式,这在你想抑制简单任务的链式思维推理以节省 token 时很有用。在多语言 n8n 部署中表现强劲。
Meta Llama 3.2 (1B, 3B) —— 专为边缘和 CPU 部署设计。1B 变体在 Q4 下体积小于 1 GB,适合在 n8n 工作流中进行轻量级分类和路由任务 —— 决定文档走哪个分支、提取一小套结构化字段、为传入记录打标签。
SmolLM3-3B (HuggingFace) —— 在 3B 规模上,它优于 Llama 3.2 3B 和 Qwen 2.5 3B,同时在广泛的基准测试中与 4B 类替代方案保持竞争力。HuggingFace 发布了完整的工程蓝图,包括架构决策、数据混合和后训练方法。
n8n 用户来自各种各样的背景、经验水平和兴趣。我们一直在尝试在我们的博客文章中突出展示不同的用户及其项目。如果你正在使用 n8n 并希望为社区提供灵感,请联系我们 💌