Kimi K3 大模型在 AWS 上的部署指南
AWS 发布 Kimi K3 在 SageMaker 和 EKS 上的两种部署方案。对需要自部署大模型的团队有实用参考价值。
AWS 发布 Kimi K3 在 SageMaker 和 EKS 上的两种部署方案。对需要自部署大模型的团队有实用参考价值。
开源权重模型已经变得足够强大,能够处理复杂任务,如多步骤 agent 工作流、高级推理和长期编码。然而,随着这些模型功能的增强,其规模也在增加,部署多万亿参数架构需要专用基础设施、高端 GPU 计算和优化的推理框架。2026 年 7 月 27 日,Moonshot AI 发布了 Kimi K3,这是一个 2.8 万亿参数的混合专家(MoE)模型,是首个达到 3 万亿参数级别的开源权重系统。Kimi K3 提供前沿级别的智能能力,同时使其权重公开可用,使组织能够在自己的基础设施上自托管现存最强大的模型之一。
本文将介绍使用两种方法在 AWS 上部署 Kimi K3 的过程:Amazon SageMaker HyperPod 和 Amazon Elastic Kubernetes Service(Amazon EKS)集群。
Kimi K3 建立在独特的架构基础上,包含 Kimi Delta Attention(KDA)、Gated Multi Head Latent Attention(MLA)和 Stable LatentMoE 框架。该模型将其 2.8 万亿参数分布在 896 个专家模型中,每个令牌仅激活 16 个。这意味着在任何单次前向传播中,大约 104 亿个参数是活跃的,相比其前代产品 Kimi K2,扩展效率提高了 2.5 倍。
Kimi K3 擅长处理长期编码任务、agent 工作流和复杂推理。它支持原生工具调用、结构化输出,以及用于多步骤问题解决的始终开启思考模式。
Kimi K3 的开源权重可在 Hugging Face 上获得,模型标识符为 moonshotai/Kimi-K3。权重以 MXFP4(Microscaling Floating Point 4-bit)格式分布,为大规模推理部署在模型质量和内存效率之间提供了有效的平衡。
考虑到模型的架构和规模,部署 Kimi K3 需要 vLLM day-0 推理容器。在撰写本文时,Kimi K3 的 vllm 提交在 vllm/vllm-openai:kimi-k3 中。我们预计这些将在即将发布的版本中合并到主 vllm 容器中。vLLM 为 MoE 架构、张量并行化和 MXFP4 量化格式提供原生支持,使其成为该模型推荐的推理引擎。
部署这种规模的模型需要大量的 GPU 计算资源。Kimi K3 需要 p6-b300 实例(ml.p6-b300.48xlarge),提供 8 个 NVIDIA B300 Blackwell Ultra GPU,具有高带宽互连,这对于在完整专家池中进行高效张量并行推理是必要的。
AWS 提供两种主要的方式来获取这种容量:
Flexible Training Plans(适用于 SageMaker HyperPod):提供承诺的容量预留,可分配给你的 HyperPod 集群,以便 GPU 资源可用于持续的推理工作负载。
Capacity Blocks:允许你在定义的时间段内预留 EC2 GPU 实例,在不长期承诺的情况下提供对 p6-b300 容量的保证访问。Amazon EKS 工作负载通过针对保留容量来使用这些预留。
Amazon SageMaker HyperPod 配合 Inference Operator 提供了部署 Kimi K3 的最简单路径。Inference Operator 在集群创建过程中自动安装,它抽象了容器编排、模型加载和端点管理的复杂性。
在部署模型之前,请完成以下两个先决步骤来设置你的基础设施。
在部署模型之前,你必须配置一个 HyperPod 集群。导航至 Amazon SageMaker AI 控制台并按照集群创建工作流程操作:
打开 SageMaker AI 控制台并选择 HyperPod Clusters > Cluster Management > Create HyperPod cluster。
从列表中选择 Orchestrated by Amazon EKS。
选择 Quick setup 以使用默认网络、存储和 IAM 资源配置集群,或选择 Custom setup 以集成现有 VPC、子网和安全组。
在 Orchestration 下,创建新的 EKS 集群或附加现有集群。验证 Use default Helm charts and add-ons 选项是否被选中,以便 Inference Operator 和其他必需的操作符自动安装。
在 Instance groups 下,添加使用 ml.p6-b300.48xlarge 实例类型配置的工作组。
查看配置并选择 Submit 开始配置。
有关完整的演练,请参考 Creating a SageMaker HyperPod cluster with Amazon EKS orchestration 文档。
ml.p6-b300.48xlarge 实例类型需要预留容量。Flexible Training Plan 为你的 Blackwell GPU 节点提供承诺的容量预留,保证 p6-b300 实例可供你的集群使用,而不会与一般按需池竞争。进入 SageMaker 控制台,根据你的时间表和实例数量选择 FTP 块。要创建或附加训练计划:
在实例组配置中,选择 Training plan 作为容量源。
选择覆盖 ml.p6-b300.48xlarge 容量的现有计划,或创建新的预留,指定你想要的实例数和持续时间。
设置 Target Availability Zone 以匹配分配了训练计划容量的区域。
一旦集群达到 Active 状态且 p6-b300 节点健康,你就可以部署模型了。
要在 HyperPod 上部署 Kimi K3,请对你的集群应用以下 InferenceEndpointConfig 清单:
apiVersion: inference.sagemaker.aws.amazon.com/v1
kind: InferenceEndpointConfig
metadata:
name: kimik3
spec:
modelName: Kimi-K3
instanceType: ml.p6-b300.48xlarge
invocationEndpoint: v1/chat/completions
replicas: 1
modelSourceConfig:
huggingFaceModel:
modelId: moonshotai/Kimi-K3
modelSourceType: huggingface
worker:
image: vllm/vllm-openai:kimi-k3
modelInvocationPort:
containerPort: 8000
name: http
modelVolumeMount:
mountPath: /opt/ml/model
name: model-weights
resources:
limits:
nvidia.com/gpu: 8
requests:
nvidia.com/gpu: 8
args:
- "--model"
- "moonshotai/Kimi-K3"
- "--trust-remote-code"
- "--load-format"
- "fastsafetensors"
- "--enable-prefix-caching"
- "--enable-auto-tool-choice"
- "--tool-call-parser"
- "kimi_k3"
- "--reasoning-parser"
- "kimi_k3"
- "--served-model-name"
- "Kimi-K3"
- "--moe-backend"
- "auto"
- "--tensor-parallel-size"
- "8"
- "--no-enable-flashinfer-autotune"
environmentVariables:
- name: "VLLM_ENABLE_K3_LATENT_MOE_TAIL_FUSION"
value: "1"
此 yaml 也可在 GitHub 仓库中获得。使用以下命令应用此配置:
kubectl apply -f kimi-k3.yaml
Inference Operator 处理从 Hugging Face 下载模型、容器调度、健康检查和端点就绪。一旦端点转到就绪状态,它就在配置的调用路径上公开 OpenAI 兼容的 API。
对于喜欢管理自己的 Kubernetes 基础设施的团队,你可以在独立的 Amazon EKS 集群上部署 Kimi K3,并通过 EC2 Capacity Blocks 获取 GPU 容量,这允许你在定义的时间段内预留 p6-b300 实例,而无需长期承诺。
AI on EKS 项目提供了一个推理就绪的集群方案,可自动化端到端配置。在高层次上,部署涉及以下阶段:
使用提供的 Terraform 模块创建 GPU 优化的 EKS 集群。这包括 VPC 网络、托管节点组以及 GPU 工作负载必需的 IAM 角色和策略。
在你的目标可用性区域为 p6-b300.48xlarge 实例创建 Capacity Block 预留。Capacity Blocks 保证在保留时间窗口内可用请求的 GPU 节点。预留变为活跃后,实例会作为工作节点加入你的 EKS 集群。
该方案在节点组上安装 NVIDIA 设备插件和 GPU 驱动程序,以便 Kubernetes 可以发现并针对可用的 GPU 进行调度。
Helm chart 或 Kubernetes 清单部署带有 Kimi K3 特定参数的 vLLM 容器,包括张量并行大小为 8、MXFP4 加载格式、MoE 后端配置。模型标识符指向 Hugging Face 仓库,或者你也可以将模型权重同步到 Amazon Simple Storage Service(Amazon S3)以加快模型加载。推理参数与上面 HyperPod 配置中显示的内容相镜像。
Kubernetes Service(类型为 LoadBalancer 或通过 Ingress 控制器)在端口 8000 上公开 vLLM 服务器,为你的应用程序提供 OpenAI 兼容的 /v1/chat/completions 端点。
通过向端点发送测试请求并验证成功的模型响应来确认部署。
有关完整的部署演练(包括 Terraform 模块、Helm 值和分步说明),请参考 AI on EKS Kimi K3 方案。
部署后,Kimi K3 端点公开一个 OpenAI 兼容的聊天完成 API。你可以使用 OpenAI Python SDK 或简单的 curl 命令调用它。
from openai import OpenAI
client = OpenAI(
base_url="http://<ENDPOINT_URL>:8000/v1",
api_key="not-needed"
)
response = client.chat.completions.create(
model="Kimi-K3",
messages=[
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Explain the benefits of mixture of experts architectures."}
],
temperature=0.7,
max_tokens=1024
)
print(response.choices[0].message.content)
curl -X POST http://<ENDPOINT_URL>:8000/v1/chat/completions \
-H "Content-Type: application/json" \
-d '{
"model": "Kimi-K3",
"messages": [
{"role": "system", "content": "You are a helpful assistant."},
{"role": "user", "content": "Explain the benefits of mixture of experts architectures."}
],
"temperature": 0.7,
"max_tokens": 1024
}'
将 <ENDPOINT_URL> 替换为 HyperPod Inference Operator 或 EKS Ingress 配置公开的服务端点。
为避免持续收费,当你不再需要在此演练中创建的资源时,请删除它们。
通过运行 kubectl delete -f kimi-k3.yaml 删除 InferenceEndpointConfig。
在 SageMaker AI 控制台中,导航至 HyperPod Clusters,选择你的集群,然后选择 Delete。
如果不再需要,释放或取消你的 Flexible Training Plan 预留。
删除 vLLM 部署和关联的 Kubernetes 服务。
使用 Terraform 终止 GPU 节点组或删除 EKS 集群(terraform destroy)。
如果 Capacity Block 预留尚未过期,请释放它。
有关 p6-b300 实例和 Capacity Block 预留的定价详情,请参考 Amazon EC2 定价页面。
Kimi K3 代表了开源权重模型能力的新前沿,AWS 提供了基础设施和托管服务来大规模部署它。无论你选择简化的 HyperPod Inference Operator 路径,还是自管理 EKS 集群的灵活性,p6-b300 GPU 实例、vLLM 推理和 MXFP4 量化权重的组合都能提供一个具有内置健康检查、自动恢复和端点就绪验证的部署,适用于世界上最大的开源模型。
要开始使用,这里是一些链接:
SageMaker HyperPod Kimi K3 示例
AI on EKS Kimi K3 方案
创建 SageMaker HyperPod 集群(AWS 文档)
Hugging Face 上的 Kimi K3