企业级RL框架,支持DeepSeek-V4、AMD MI355X等大规模分布式RL训练,已对接SGLang实现day-0模型支持,覆盖 Diffusion-on-policy distillation等前沿能力。
Miles 是一个高性能、企业级的强化学习框架,专为大规模模型后训练而设计。它将 SGLang 用于高吞吐量 rollout,Megatron-LM 用于可扩展训练,并提供万亿参数规模 RL 运行所需的精度、稳定性和可观测性特性。PyTorch FSDP2 后端可用于直接训练 HuggingFace 实现版本的运行,但所有配方、并行策略和最大模型都基于 Megatron-LM。参见 Training Backends。
"千里之行,始于一次 rollout。"
Rollout 和训练 Worker 完全解耦,支持可配置的在策略与离策略调度、针对减少气泡优化的流水线,以及可定制的异步 rollout 和评估模式。参见 Fully Async RL。
生成任务在 SGLang 上运行,后接路由器将请求分发到各个引擎、保留每请求元数据并对集群进行健康检查。针对多轮 Agentic 工作负载进行了调优。
新权重在循环内即可在秒级到达引擎,即使在 Kimi-K2.6 这样万亿参数的模型上也能做到,解聚合场景下 P2P RDMA 是快速路径。
MXFP8 和 NVFP4 训练采用数值稳定的 RL 配方,减少因精度导致的发散。同时支持 FP8、INT4 QAT、BF16 和 FP16。
低秩适配器可以在少量 GPU 上训练前沿规模模型,相同适配器可直接加载到 SGLang 用于 rollout。
适用于所有模型和所有黑盒测试框架,rollout 和训练之间无需 detokenize/retokenize 往返。
在 rollout 期间记录的专家路由会在训练器的前向传播中回放,消除 MoE 路由不匹配问题——这个问题会导致大规模运行不稳定,同时通过计算与通信重叠保持成本可控。
当 SGLang 引擎故障时,Miles 会将其恢复并在原地继续运行:无需重启、无需暂停。
DeepSeek-V4、Kimi-K3、GLM-5.2、Inkling 和 Nemotron 均在发布日上线。除 Day-0 之外,几乎所有前沿模型均可在 Miles 上运行,包括 Kimi-K2.6 和 Qwen3.5。参见 Models。
NVIDIA GB300、GB200、B300、B200、H200、H100 和 A100,以及通过 ROCm 支持的 AMD MI300X、MI325、MI350 和 MI355X。参见 Installation 获取各 GPU 状态和对应容器镜像。
RL 方面支持 GRPO、GSPO、PPO 和 REINFORCE++,此外还有 SFT 和在策略蒸馏。
通过 Harbor、HUD、NeMo Gym、OpenEnv、Verifiers 等连接器训练编码和计算机使用 Agent,每个连接器接入适合自身的 rollout 层,任务沙箱位于 AgentENV、Daytona、E2B 或 Modal 上。参见 Agentic Environments。
在 Miles-diffusion 中,通过 sglang-diffusion rollout 引擎和 FSDP2 训练器实现 Flow-GRPO、DiffusionNFT 和 SFT。
Miles 从 slime 分叉,集成了 SGLang、Megatron-LM 和 torch_memory_saver。
Miles 由以下团队塑造并推动其发展:硬件厂商、云服务商、模型实验室、Agent 基础设施团队和学术界:
如果 Miles 对你的研究或产品有所帮助,请引用它:
@misc{miles2026,
title = {Miles: Enterprise-Grade Reinforcement Learning for Large-Scale Model Post-Training},
author = {Miles Team},
year = {2026},
howpublished = {\url{https://github.com/radixark/miles}}
}