📌 项目地址:radixark/miles | ⭐ 2,511 颗星 | 🔧 Python | 📜 未标注
先说清楚它是干什么的
Miles 是一个面向大规模模型后训练的强化学习框架,自我定位是”enterprise-grade”。它不做玩具级 demo,目标是万亿参数规模的 RL 训练。
架构上就一条主线:SGLang 负责高吞吐 rollout,Megatron-LM 负责分布式训练。这两个都是生产验证过的系统,Miles 把它们拼成一个完整的 RL 训练管线,并补上大规模训练需要的三样东西——precision、stability、observability。
README 里也留了后路:PyTorch FSDP2 后端可以直接训练 HuggingFace 原生实现。但官方话讲得很直白,训练配方、并行策略、最大模型的支持全在 Megatron 一侧。所以 FSDP2 是逃生通道,不是主路径。
项目 slogan 是 “A journey of a thousand miles begins with a single rollout.”,名字来源可见一斑。
从 News 时间线能读出什么
这个项目的 README 被截断了,News 部分信息量反而最大。我按时间捋了一遍,它在解决的工程问题分几类:
分布式效率
2026 年 4 月,P2P 权重传输上线,官方说法是”秒级更新 1T 参数”。RL 训练里 rollout 引擎和训练引擎之间的权重同步是老瓶颈,这个数字值得自己去文档里验证细节。
量化训练
2026 年 7 月,端到端的 MXFP8(8-bit)和 NVFP4(4-bit)RL,官方称之为”Blackwell 原生”。低精度直接压显存,对千卡规模的成本影响是乘法级的。
硬件覆盖
不是 NVIDIA-only。2026 年 7 月有在 AMD Instinct MI355X 上跑 DeepSeek-V4 Flash RL 训练的记录。
训练方法
On-policy distillation 于 2026 年 7 月落地。5 月有一个 “token-in-token-out” 的更新,官方博客标题叫 “No token left behind”,具体机制我建议直接读原文。
模型支持速度
这是我觉得最有说服力的一点。DeepSeek-V4、NVIDIA Nemotron 3 Ultra、Kimi K3、多模态模型 Inkling,全部是 day-0 支持——模型发布当天就能上 RL 训练。背后是 Miles 和 SGLang 生态的深度绑定。实际工程里,新模型架构适配往往要自己改推理框架,这个成本被转嫁掉了。
版本方面,v0.1 于 2026 年 8 月发布,项目还年轻。
怎么上手
README 正文在 News 之后被截断,没有可直接引用的安装命令,我不编造。相关入口:
- 文档总入口:https://miles.radixark.com/docs
- Quick Start:https://miles.radixark.com/docs/getting-started/quick-start
- 支持的模型列表:https://miles.radixark.com/docs/models
- 训练后端选择(Megatron vs FSDP2):https://miles.radixark.com/docs/user-guide/training-backend
配套项目 Miles Diffusion 在独立仓库(https://github.com/radixark/miles_diffusion)。社区讨论在 SGLang Slack 的 #miles-rl 频道,博客文章集中在 lmsys.org(可按 miles 过滤)。
和同类框架比,它站哪
RL 后训练框架现在不少:OpenRLHF、verl、TRL 都在做类似的事。Miles 的路线差异在两点:
重规格。多数轻量框架走 FSDP + vLLM,单机到几台机器够用。Miles 把最重的模型、最激进的并行策略放在 Megatron 侧,目标用户是在几百上千卡上跑 RL 的团队。如果你没有集群,这个项目大概率不是为你准备的。
长跑稳定性。官方明确强调 precision、stability、observability。RL 训练动辄跑几天,一个 run 挂在第 300 步,损失的不只是时间。这类工程细节是轻量框架普遍薄弱的地方,也是 Miles 想收企业用户的地方。
我的判断
2,511 颗星对这类重型框架来说不算高(对比 verl 的量级),但它的目标用户基数本来就小——能把千卡集群跑起来的团队,全世界也就那么多。
适合看的场景:你有集群资源,要在最新前沿模型上做 RL 后训练,且在意长跑稳定性。中小规模实验、学术复现,verl 或 TRL 上手成本低得多。
最后一句提醒:版本才 v0.1,API 会有变动,生产使用前锁版本、盯 changelog。