Miles框架支持模型全景图:Qwen3、DeepSeek、Kimi、GLM、Nemotron谁能跑RL训练
【免费下载链接】milesMiles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.项目地址: https://gitcode.com/GitHub_Trending/miles1/miles
Miles 是一个面向企业级的大模型强化学习(RL)训练框架,基于 SGLang 高吞吐推理 + Megatron-LM 大规模训练的组合,专门解决 LLM / VLM 后训练场景。最让新手关心的问题是:Miles 到底支持哪些模型?Qwen3、DeepSeek、Kimi、GLM、Nemotron 这些热门模型,谁能跑 RL 训练?本文给你一张完整的支持模型全景图,并附上每个家族的"最快上手路径"。
支持模型全景图:一眼看清谁能跑RL
Miles 官方为每个模型家族都提供了可直接运行的训练配方(recipe),覆盖权重转换、并行策略和启动脚本。完整清单见 docs/models/index.md。
| 模型家族 | 代表模型 | 规模(激活/总参数) | 单机可跑? |
|---|---|---|---|
| Qwen | Qwen3 / Qwen3.5 / Qwen3.6 | 0.6 B → 235 B-A22B(MoE) | ✅ Qwen3-4B 单节点 |
| DeepSeek | V4.1 Flash / V4 Flash / V3.2 | 284 B → ~750 B | ❌ 需多节点 |
| Kimi | K2.5 / K2.6 / K3 | 1 T(32 B 激活) | ✅ 2-layer 冒烟测试 |
| GLM | GLM-4.5 / GLM-5 / GLM-5.2 | 106 B-A12B → 744 B-A40B | ✅ GLM-4.7-Flash 单节点 |
| Nemotron | Nemotron-3 Nano → Ultra | 4 B → 550 B-A55B | ✅ Nano 4B 单节点 |
| 其他 | Gemma-4、GPT-OSS-20B、Inkling、JoyAI-LLM-Flash | — | 视规模而定 |
结论先行:这五个家族的模型全部能跑 RL 训练,区别只在于需要多少卡、多少节点。
Qwen:新手入门的第一选择
Qwen 是 Miles 覆盖最全的家族:从稠密的 Qwen3(0.6B → 32B)到 MoE 的 Qwen3-30B-A3B / 235B-A22B,再到 Qwen3.5、Qwen3.6 全系,以及 Gated-Delta-Net 架构的 Qwen3-Next-80B-A3B。
新手最快路径是 Qwen3-4B,单台 8×H100 节点即可跑通,使用 scripts/run_qwen3_dense.py 一条命令启动,详见 docs/models/qwen/index.md:
python scripts/run_qwen3_dense.py --model-name Qwen3-4B📌 选型建议:
- 第一次学 Miles→ Qwen3-4B(一个节点,循环快)
- 想体验 MoE→ Qwen3-30B-A3B
- 多节点扩规模→ Qwen3-235B-A22B,脚本见 scripts/run_qwen3_235b_a22b.py
DeepSeek:旗舰级MoE,多节点才是主场
DeepSeek 家族横跨三代:DeepSeek-V3、V3.2(新增稀疏注意力 DSA)、V4 Flash(284B)以及最新的 V4.1 Flash(约 750B,激活仅 6B 专家)。
- DeepSeek-V4 Flash:8 节点 8×H200,用 scripts/run_deepseek_v4.py 启动
- DeepSeek-V3.2:8 训练节点 + 独立 rollout GPU,脚本见 scripts/run_deepseek_v32.py
DeepSeek 系列配方还与低精度 RL(FP8/MXFP8)、P2P 权重传输、容错恢复等高级特性配合最佳,详见 docs/models/deepseek/index.md。
Kimi:万亿参数也能训,K3 首发即支持
Kimi 家族在 Miles 上从顶到全支持:K2-Instruct / K2-Thinking、多模态智能体的 K2.5 / K2.6(均为 1T 总参数、32B 激活),以及首发(day-0)支持的Kimi-K3——KDA + MLA 混合注意力 + 896 专家潜空间 MoE。
- K2.5 / K2.6 走INT4 QAT训练路径,先用 2-layer 冒烟测试验证环境:
python scripts/run_kimi_k25.py full-train --model-name Kimi-K2.5-2layer - K3 采用LoRA RL(冻结基座权重、只训低秩适配器),这是让它在有限卡数上跑得动的关键,16 节点 4 卡已验证,配方见 docs/models/kimi/kimi-k3.md
💡 一句话:万亿参数模型在 Miles 上不是传说——Kimi-K2.6 的新权重可以在几秒内通过 P2P RDMA 同步到所有推理引擎。
GLM:从单节点冒烟到 744B 旗舰全覆盖
GLM 家族的 RL 训练配方覆盖每一代:GLM-4.5(106B-A12B / 355B-A32B)、紧凑的 GLM-4.7-Flash、旗舰级 GLM-5 / GLM-5.2(744B-A40B),以及 KDA + DSA 混合架构的 GLM-5.3-Flash。
- GLM-4.7-Flash:全家族最小配方,单台 8×H100 节点即可:
python scripts/run_glm47_flash.py - GLM-5.2(744B):完整多节点配方见 scripts/run_glm5_2_744b_a40b.py,也支持 LoRA 版 scripts/run_glm5_2_744b_a40b_lora.py
Nemotron:Mamba混合架构,免权重转换直达训练
NVIDIA 的 Nemotron-3 全系(Mamba + Attention 混合架构,Super 档还带 MoE 且原生 FP8)都通过 Megatron AutoBridge 路径加载,无需离线 HF → torch_dist 权重转换,省掉新手最容易踩坑的一步。
| 档位 | 规模 | 硬件规模 |
|---|---|---|
| Nano(稠密) | 4 B | 单节点 8 卡,最快冒烟 |
| Nano MoE | 30 B-A3B | 中等规模 |
| Super(FP8 原生) | 120 B-A12B | 多节点 |
| Ultra | 550 B-A55B | 16 节点 |
单节点启动命令:
python scripts/run_nemotron_3_nano.py --model-name NVIDIA-Nemotron-3-Nano-4B-BF16配方详情见 docs/models/nemotron/index.md。
算法与硬件:跑通模型之后还有什么
RL 算法:GRPO、GSPO、PPO、REINFORCE++ 全部内置,另支持 SFT 与 on-policy 蒸馏,PPO 示例见 examples/ppo/run_qwen3_4b_ppo.py。
硬件:NVIDIA GB300 / GB200 / B300 / B200 / H200 / H100 / A100,以及 AMD MI300X / MI325 / MI350 / MI355X(ROCm)——DeepSeek-V4 Flash 还已在 AMD MI355X 上完成 RL 训练验证。
低精度训练:MXFP8、NVFP4 端到端 RL,外加 FP8、INT4 QAT、BF16、FP16,小卡预算也能训大模型,示例脚本在 examples/infra_features/low_precision/ 目录。
新手上手路径:最小成本跑通第一个RL训练
- 选小模型:Qwen3-4B 或 Nemotron-3-Nano-4B,单台 8 卡节点
- 跑冒烟测试:Kimi-K2.5 的 2-layer 变体适合先验证环境
- 再看指标:健康的训练运行中,
rollout/raw_reward应随 rollout 稳步上升,eval 分数(如 AIME)在若干轮后明显抬升
🎯 记住这张表的选型口诀:
学框架 → Qwen3-4B;试 MoE → GLM-4.7-Flash / Qwen3-30B-A3B;上旗舰 → DeepSeek-V4 Flash、Kimi-K2.5、GLM-5.2 多节点满配。
Miles 的插件架构还允许你把任意 HuggingFace 模型包装成 Megatron 模块接入训练,意味着这份"支持模型全景图"还在持续扩展中。
【免费下载链接】milesMiles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.项目地址: https://gitcode.com/GitHub_Trending/miles1/miles
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考