27B参数开源模型,100万token上下文窗口,输入$0.45/M、输出$3.20/M,代码能力经实测可靠,适合自托管。
TL;DR — Qwen3.8-27B 是一款 27B 参数的开源权重模型,元数据验证的上下文窗口为 1,000,000 token,输入 $0.45/M token,输出 $3.20/M token。探针测试显示代码正确、多步算术准确、结构化 JSON 提取有效——这正是自托管用户和想要摆脱 API 账单成本的创业公司真正需要的那种可靠的中间量级性能。这将开启一个关于开源权重模型的 30 天系列,覆盖模型本身、周边工具以及它们真正发挥作用的具体场景。
两年前,"开源权重模型"意味着你下载下来证明概念的一个玩具。如今它意味着某个人的创业公司赖以运行损益表的生产级依赖。从新奇事物到基础设施——这种转变就是这个系列的由来。接下来 30 天,我将逐一梳理那些模型、服务工具,以及开源权重真正在干活的地方。第一天的主角是一款恰好处于这些决策临界点的参数量级:Qwen3.8-27B。
中量级模型不断出现在严肃部署场景中,而不是旗舰 70B 以上梯队,自有它的道理。27B 模型是你通常能 pinned 到单张高端 GPU 上而不必动用多节点服务的最大参数量级——这改变的是谁能跑得起它,而不只是它跑得多好。Qwen3.8-27B 的元数据列出上下文长度为 1,000,000 token,对于这个量级来说这是一个引人注目的数字:意味着这个模型不仅托管成本低,而且还内置了能容纳整个代码库、长篇合同或冗长对话历史而不需要分块切片的构建能力。
定价支撑了"摆脱 API 账单"的卖点:列示价格为每百万输入 token $0.45,每百万输出 token $3.20。这不是免费的——自托管仍有 GPU 小时的成本——但这个数字足以让团队认真算一笔:租 GPU 和按量付费的 API 调用,哪个更划算,而不是凭空假设。
规格表上的数字在跑通之前只是营销。我跑了三个探针——代码、推理、结构化输出——并阅读了完整 transcript,而不是只看分数。
代码探针要求写一个 merge_intervals 函数加一句复杂度说明。输出对区间排序、正确合并了重叠区间、返回了正确构建的结果列表——没有差一错误,空输入分支的边界情况也没有遗漏。最后给出"O(n log n),因为对区间排序主导了线性合并过程",这是正确且论证充分的答案。延迟 3.7 秒生成 256 个 completion token,实测 69 tokens/秒。
推理探针是一道抽水蓄能的文字题:双泵同时运行的净注入速率、剩余容积、只剩一泵时完成所需时间。模型的每一步算术都核对无误——净 30 L/min,20 分钟后 600 L,剩余 1,800 L,以 90 L/min 还需要 20 分钟——最终得出正确答案。整个过程 5.5 秒,295 个 token,53.9 tokens/秒,明显比代码探针慢,这与任务本身需要更多逐步推理 scaffolding 的情况一致。
结构化输出探针是我在生产场景中最在意的:从不含发票字符串中提取 vendor、date 和 total,输出严格 JSON,不要其他内容。返回的对象是合法的、精确匹配所请求的 schema——没有 markdown 围栏、没有解释性前言、没有多余的评注。这就是能直接 pipe 到下游解析器的模型和需要用 regex 事后清理的模型之间的区别。它也是三个探针中跑得最快、吞吐量最高的:3.4 秒,122.5 tokens/秒——不过 completion token 数(414)与短小可见输出之间的反差值得标注为这次运行报告用量方式的特殊性,而非推理失败。
这一节比任何 benchmark 表格都重要。模型能力只有映射到具体任务和约束条件上才有意义。
有单块 GPU 且有隐私需求的,自托管用户。如果你在跑文档问答、内部搜索,或者在不能离开网络的合同和日志上跑 agent,27B 模型配合 1,000,000 token 上下文窗口,尺寸恰到好处:能装进你已有的硬件里,而且上下文窗口大到足以容纳真正的语料,而不是用 4K 分块拼凑出来的脆弱 RAG pipeline。
有单块 GPU 且有隐私需求的,自托管用户。如果你在跑文档问答、内部搜索,或者在不能离开网络的合同和日志上跑 agent,27B 模型配合 1,000,000 token 上下文窗口,尺寸恰到好处:能装进你已有的硬件里,而且上下文窗口大到足以容纳真正的语料,而不是用 4K 分块拼凑出来的脆弱 RAG pipeline。
在做 API 账单数学的创业公司。按 $0.45/$3.20 每百万 token 的价格,一个团队如果在旗舰级托管 API 上为结构化提取、代码审查或内部推理任务花的钱明显超过这个数,就有了一个真实的自托管case——而不是假设的。上方探针中干净的 JSON 输出恰好是这种工作负载(发票解析、日志转记录、表单数字化),中量级模型在这里无需前沿级推理能力就能物尽其值。
在做 API 账单数学的创业公司。按 $0.45/$3.20 每百万 token 的价格,一个团队如果在旗舰级托管 API 上为结构化提取、代码审查或内部推理任务花的钱明显超过这个数,就有了一个真实的自托管case——而不是假设的。上方探针中干净的 JSON 输出恰好是这种工作负载(发票解析、日志转记录、表单数字化),中量级模型在这里无需前沿级推理能力就能物尽其值。
需要已经具备能力基座模型的微调者。27B 密集模型是 LoRA 和全量微调的常见目标,因为足够大所以适应后仍能保留细节,又足够小所以微调运行不需要 GPU 集群。如果你的目标任务看起来和上面的探针类似——代码生成、多步算术推理、schema 约束提取——你是在微调一个已经接近的东西,而不是从零教起。
需要已经具备能力基座模型的微调者。27B 密集模型是 LoRA 和全量微调的常见目标,因为足够大所以适应后仍能保留细节,又足够小所以微调运行不需要 GPU 集群。如果你的目标任务看起来和上面的探针类似——代码生成、多步算术推理、schema 约束提取——你是在微调一个已经接近的东西,而不是从零教起。
长上下文 agent 构建者。百万 token 上下文声明(据模型元数据)打开了一些完全装不进小上下文开源模型的工作负载:整个 repo 的代码审查、多文档法律对比、或者能贯穿整个工作日而不需要额外叠加摘要层的会话记忆。这个上下文窗口在真实 retrieval 压力下、在范围远端是否仍能保持表现,是另一个这些探针没有回答的问题——它们测试的是短提示下的正确性,而非长上下文 recall。
长上下文 agent 构建者。百万 token 上下文声明(据模型元数据)打开了一些完全装不进小上下文开源模型的工作负载:整个 repo 的代码审查、多文档法律对比、或者能贯穿整个工作日而不需要额外叠加摘要层的会话记忆。这个上下文窗口在真实 retrieval 压力下、在范围远端是否仍能保持表现,是另一个这些探针没有回答的问题——它们测试的是短提示下的正确性,而非长上下文 recall。
这个模型不适合谁:需要无论成本都要达到推理性能绝对天花板团队,或者对自建推理服务栈零容忍的团队。自托管 27B 模型并不能消除你自己 serving、监控和更新权重所带来的运维负担——这种负担就是换取更低 per-token 价格和数据控制的代价。
三个探针只是冒烟测试,不是 benchmark 套件——把这里干净的结果视为模型在常见模式上具备能力的证据,而非它在对抗性或高度专业化任务上无懈可击的证明。价格和上下文数字直接来自模型列示的元数据;我没有独立验证百万 token 上下文在大规模下是否依然成立,你也不应该在把生产工作负载押注上去之前就轻信——先用自己的长文档测试。
明天的章节从模型转向大多数人实际用来本地跑模型的东西:Ollama,以及它如何改变了"下载一个 GGUF 然后跑起来"的体验。
今天写这篇文章之前,我通过托管 API 对 Qwen3.8-27B 跑了三个快速探针。样本小,单一时点快照,经过我不控制的路由硬件——把这些当作嗅觉测试,而不是 benchmark:
有效 tokens/秒包含了排队时间和 time-to-first-token——这是你实际体验到的,而非峰值解码速度。
Model card:context window 1,000,000 tokens · 托管定价 $0.45/M 输入 · $3.2/M 输出 · 权重:Hugging Face 上的 Qwen/Qwen3.8-27B


阿里云 Qwen 团队——训练了 Qwen3.8-27B 并公开开源了权重:Qwen/Qwen3.8-27B。像这样的开源发布正是这类系列能够存在的根本原因。
OpenRouter——为今天的 live 探针以及定价/上下文数字提供托管 API。
量化器和运行时维护者——这些大多数无偿付出的人,让每一个开源发布在几天内就能在真实硬件上跑起来。