Kimi K3 是稀疏 MoE 架构,100 万 token 上下文窗口真实可用,前端编码任务排名第一。输出 token 成本约 GPT-5.6 Sol 的 1/2,Claude Fable 5 的 1/3。
Moonshot AI 的 Kimi K3 于 2026 年 7 月上线,这是今年第一款让我重新跑成本-per-task 基准测试的模型。2.8T 参数的 Mixture-of-Experts 模型,100 万 token 的上下文窗口,输出 token 定价大约是 GPT-5.6 Sol 的三分之一。以下是详细拆解。
K3 是一个稀疏 MoE 模型——总计 2.8T 参数,但每个 token 只激活其中一小部分。这正是其定价激进的原因:你为活跃计算量付费,而非整个权重矩阵。100 万上下文窗口是实打实的(不是营销噱头"最高可达"),在我对大型代码仓库转储的测试中,即使超过 50 万 token 也能保持良好的一致性。
TextArena:全球第 9 名——通用推理和指令遵循均进入前十
前端编码:第 1 名——在 UI 生成和组件任务上超越所有前沿模型
GDPval-AA:第 3 名——智能体评估表现强劲
前端编码第一对我来说才是重点。如果你正在构建代码生成工具,这是一个直接信号。
在输出 token——也就是成本的大头——上,K3 比 GPT-5.6 Sol 便宜约 2 倍,比 Claude Fable 5 便宜约 3.3 倍。对于每月生成 5000 万输出 token 的工作负载,这意味着费用从约 350 美元降到约 107 美元。
缓存命中每百万 token 仅 0.05 美元,缓存输入有 88% 的折扣。
对于编码 Agent,这完全改变了经济学逻辑。一个典型的 Agent 循环在每次交互时都会重新发送相同的系统 prompt、文件树和上下文。有了缓存后,重复输入从每百万 token 0.43 美元降到 0.05 美元。在长时间的智能体会话中,缓存命中率可达输入量的 70-90%——因此你的有效输入成本会降至每百万 token 0.08-0.12 美元。
这个数字使得 K3 成为常驻型编码助手的经济可行方案。
在你问之前:不行。2.8T 参数至少需要约 8×H100 才能部署可用,而且在 100 万上下文下运行 KV 缓存还需要更多硬件。这还没算电力、冷却和运维费用,硬件成本就超过 15 万美元。除非你把推理当作一项业务来运营,否则通过 API 调用始终更便宜。
务实的路径是统一网关。Yingsuan AI 用一个 API key 就能访问 K3、DeepSeek 和 GLM——无需信用卡即可开始,支持 Wise 支付,方便没有美国银行卡的全球开发者充值。
一个 key,多个前沿模型,不存在各提供商之间的供应商锁定。对于需要在 K3(前端/代码生成)和 DeepSeek 或 GLM(推理/成本敏感的批量任务)之间路由的团队,这大大减少了集成开销。
K3 兼容 OpenAI 格式,只需改两行代码:
from openai import OpenAI
client = OpenAI(
api_key="YOUR_YINGSUAN_KEY",
base_url="https://api.yingsuan.ai/v1" # unified gateway
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "system", "content": "You are a senior frontend engineer."},
{"role": "user", "content": "Build a responsive pricing table in React + Tailwind."}
],
temperature=0.3,
max_tokens=4096
)
print(response.choices[0].message.content)
print("tokens:", response.usage)
把 model 换成 deepseek-v3 或 glm-5 即可路由到其他模型——同一个 key,同一个 SDK。
保持系统 prompt 和静态上下文在多次调用中完全一致即可启用缓存。网关会透传 cache_control,你可以在使用量响应中看到命中率。
如果你想先测试再决定:
网关上有 3 个永久免费模型(适合原型开发和轻量批量任务)
K3 有 100 次试用调用,可针对你自己的工作负载跑基准测试
这些足够让你用真实 prompt 在 K3 上跑一遍,并与当前提供商的 cost-per-task 做对比——这才是唯一重要的基准。
K3 不是一个"更便宜的替代品"的故事。前端编码第一加上每百万 token 0.05 美元的缓存命中价格,使它成为代码生成和智能体工作负载的首选模型,成本只是附带的优势。如果你目前在为前端生成支付 GPT-5.6 或 Claude Fable 5 的费率,跑一下 100 次试用调用,算算你自己流量的账。