Kimi K3(2.8T MoE)开源登HF,GPT-5.6 Luna输入价从$1降至$0.20,Terra推理速度分层不加价,7月中的选型评估已过时。
过去这一周,可能是 2026 年模型市场信息密度最高的一周。7 月 26 日,月之暗面将 2.8 万亿参数 Kimi K3(1.56TB)的完整权重放上了 Hugging Face;7 月 29 日至 31 日,SK Telecom 和 LG 相继以 Apache 2.0 协议开源了 688B 和 750B 主权模型;7 月 30 日,OpenAI 宣布 GPT-5.6 Luna 降价 80%、Terra 降价 20%,并将 Priority Processing 替换为提速 2.5 倍的 Fast 模式。此外,Anthropic 早前已将 Claude Opus 5 以与 Opus 4.8 相同的价格换上架,Google 发布了主打低成本的 Gemini 3.6 Flash——如果你在 7 月中旬做了一次模型选型评估,它在今天已经过时了。BenchLM 的前沿模型价格指数提供了定量注脚:以 GPT-4 在 2023 年 3 月发布时的价格为基准 100,到 7 月 31 日该指数为 12,累计下跌 88%。但值得注意的是,该指数实际上环比上涨了 2.6%——价格下降并非单向通道。新旗舰产品(如 GPT-5.4 Pro,定价 $30/$180)正在推高天花板,而低端产品不断击穿地板;价格带正在两端同时扩宽。
Luna 从 $1/$6(每百万输入/输出 token)降至 $0.20/$1.20,组合成本从 $7 降至 $1.40;Terra 从混合价 $17.50 降至 $14;Sol 标准档维持在 $5/$30,但新增 Fast 模式:在智力水平不变的前提下,以 $10/$60 的价格提供标准档 2.5 倍的速度,被标记为旧版 priority 的请求自动兼容。OpenAI 官方博客将降价归因于三层效率提升:模型本身"以更直接的路径完成工作",推理系统路由保持硬件高利用率,agentic 工具链的上下文管理避免冗余计算。更值得关注的是,GPT-5.6 Sol 在人工主导的流程中自主重写并优化了生产推理内核,将端到端服务成本降低 20%,将 token 生成效率提升超过 15%——模型开始参与到自身服务成本的降低中。这个反馈循环,是本轮降价具有可持续性的技术基础。
K3 是一个 2.8T 参数的 MoE 模型:896 个专家,每个 token 激活 16 个(另有 2 个共享专家),每次前向传播约 104B 参数(~3.7%)处于活跃状态。它从 SFT 阶段就支持量化感知,原生携带 MXFP4 权重,拥有 100 万 token 的上下文窗口。它在 Artificial Analysis 智力指数上得分 57,紧随 Claude Fable 5(~60)和 GPT-5.6 Sol(~59)之后——这是开源模型首次闯入独立排行榜前三。对于工程团队而言,K3 最重要的启示不是参数规模,而是服务市场的格局:权重公开十天内,包括 Kimi、Fireworks、Together AI、Modal、Nebius 和 Databricks 在内的十家 API 提供商已提供推理服务,混合后每 token 定价低至约 $2.31/百万 token,输出速度从官方的 35.9 t/s 到最快宿主的 172 t/s——近 5 倍的差距。同一模型,各供应商的价格和速度截然不同——这正是"供应商选择"本身成为架构问题的原因。而自托管的账本令人清醒:约 1.4TB 常驻显存,官方推荐的超节点为 64 卡以上,按 Modal 的无服务器费率,64 张 H200 每月约 $212,000。以 $9/百万 token 的混合价格计算,每月需要处理约 236 亿 token 才能回本——对绝大多数团队而言,正确答案仍然是调用 API。

同一系列内,Luna 与 Terra 相差 10 倍,Terra 与 Sol 相差 2.5 倍;跨供应商,最高与最低档相差近 50 倍。价格分层从未如此陡峭——这意味着"将所有请求发送给同一模型"的架构,正在为不需要的智能支付真金白银。
当低端模型组合成本降至 $1.40/百万 token,且"能够使用工具并运行多步工作流"(OpenAI 对 Luna 的官方表述),按任务复杂度进行合理的架构分层就顺理成章了:
# 基于 OpenAI 兼容接口的分 tier 路由草图
ROUTES = {
"classify": "gpt-5.6-luna", # 高吞吐量轻量任务
"extract": "gemini-3.5-flash-lite",
"generate": "gpt-5.6-terra", # 日常生成
"longdoc": "kimi-k3", # 百万上下文长文档
"agentic": "claude-opus-5", # 复杂推理/多步规划
}
def chat(task_type: str, messages: list):
return client.chat.completions.create(
model=ROUTES[task_type],
messages=messages,
)
问题在于:这五个模型来自四个供应商,每个供应商都有各自的 API 密钥、计费方式、速率限制和合规要求;而且如前所述,价格表每周都在变化,而像 K3 这样的开源模型仍需在十家供应商之间比较价格和速度。自己维护所有这些集成、比较和故障转移逻辑,是一笔持续的工程税。
这正是模型 relay 的价值所在。以 wrouter.ai 为例:它在单一的 OpenAI 兼容端点背后汇聚了上述所有供应商模型,让开发者只需修改 model 参数即可切换:
client = OpenAI(
base_url="https://api.wrouter.ai/v1",
api_key=***
)
# 上周我们用 terra;本周 Luna 降价 80%,只需一行代码将轻量任务切换过去
resp = client.chat.completions.create(
model="gpt-5.6-luna",
messages=[{"role": "user", "content": "Classify the following tickets:..."}],
)
针对本文涉及的三个场景,它恰好回答了价格战暴露出的三个问题。其一,稳定性——当单一供应商被限速或出现故障时(例如,K3 发布后月之暗面曾短暂暂停新的 API 订阅),relay 层可以在多个上游之间故障转移,业务侧零感知。其二,模型完备性——GPT、Claude、Gemini、Kimi 的主流模型均可在同一端点获取,价格表变化时切换成本接近为零,无需为每个新模型重新集成独立 SDK。其三,合规性——统一的账单和访问入口比在多个海外平台开卡、付款更容易通过企业审计。只有具备"随时切换"能力的团队,才能真正捕获价格战红利。如果架构将模型视为可替代的大宗商品,业务侧就能享受大宗商品化的价格。
本周三件事——闭源降价、开源登顶、推理速度分 tier——都指向同一个趋势:单模型忠诚度的回报正趋向于零,而多模型编排的回报正在增长。我们建议每个团队本周做一次"价格表健康检查":按任务复杂度对现有流量分桶,与上面的价格带对比,估计迁移到分 tier 路由后的账单影响。大多数团队会发现,这可能是今年投资回报率最高的架构变更。
OpenAI: Advancing the price-performance frontier with GPT-5.6
AI2Work: Kimi K3 Ships 2.8T Open Weights and Cracks the Independent Top Three
FreshUsNews/VentureBeat: AI price wars — OpenAI cuts GPT-5.6 Luna prices by 80%
BenchLM: LLM API Pricing Trends & Updates (August 2026)
MarkTechPost: Thinking Machines Lab Releases Inkling-Small