Miles框架支持模型全景图:Qwen3、DeepSeek、Kimi、GLM、Nemotron谁能跑RL训练
2026/9/17 18:49:23 网站建设 项目流程

Miles框架支持模型全景图:Qwen3、DeepSeek、Kimi、GLM、Nemotron谁能跑RL训练

【免费下载链接】milesMiles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.项目地址: https://gitcode.com/GitHub_Trending/miles1/miles

Miles 是一个面向企业级的大模型强化学习(RL)训练框架,基于 SGLang 高吞吐推理 + Megatron-LM 大规模训练的组合,专门解决 LLM / VLM 后训练场景。最让新手关心的问题是:Miles 到底支持哪些模型?Qwen3、DeepSeek、Kimi、GLM、Nemotron 这些热门模型,谁能跑 RL 训练?本文给你一张完整的支持模型全景图,并附上每个家族的"最快上手路径"。

支持模型全景图:一眼看清谁能跑RL

Miles 官方为每个模型家族都提供了可直接运行的训练配方(recipe),覆盖权重转换、并行策略和启动脚本。完整清单见 docs/models/index.md。

模型家族代表模型规模(激活/总参数)单机可跑?
QwenQwen3 / Qwen3.5 / Qwen3.60.6 B → 235 B-A22B(MoE)✅ Qwen3-4B 单节点
DeepSeekV4.1 Flash / V4 Flash / V3.2284 B → ~750 B❌ 需多节点
KimiK2.5 / K2.6 / K31 T(32 B 激活)✅ 2-layer 冒烟测试
GLMGLM-4.5 / GLM-5 / GLM-5.2106 B-A12B → 744 B-A40B✅ GLM-4.7-Flash 单节点
NemotronNemotron-3 Nano → Ultra4 B → 550 B-A55B✅ Nano 4B 单节点
其他Gemma-4、GPT-OSS-20B、Inkling、JoyAI-LLM-Flash视规模而定

结论先行:这五个家族的模型全部能跑 RL 训练,区别只在于需要多少卡、多少节点。

Qwen:新手入门的第一选择

Qwen 是 Miles 覆盖最全的家族:从稠密的 Qwen3(0.6B → 32B)到 MoE 的 Qwen3-30B-A3B / 235B-A22B,再到 Qwen3.5、Qwen3.6 全系,以及 Gated-Delta-Net 架构的 Qwen3-Next-80B-A3B。

新手最快路径是 Qwen3-4B,单台 8×H100 节点即可跑通,使用 scripts/run_qwen3_dense.py 一条命令启动,详见 docs/models/qwen/index.md:

python scripts/run_qwen3_dense.py --model-name Qwen3-4B

📌 选型建议:

  • 第一次学 Miles→ Qwen3-4B(一个节点,循环快)
  • 想体验 MoE→ Qwen3-30B-A3B
  • 多节点扩规模→ Qwen3-235B-A22B,脚本见 scripts/run_qwen3_235b_a22b.py

DeepSeek:旗舰级MoE,多节点才是主场

DeepSeek 家族横跨三代:DeepSeek-V3、V3.2(新增稀疏注意力 DSA)、V4 Flash(284B)以及最新的 V4.1 Flash(约 750B,激活仅 6B 专家)。

  • DeepSeek-V4 Flash:8 节点 8×H200,用 scripts/run_deepseek_v4.py 启动
  • DeepSeek-V3.2:8 训练节点 + 独立 rollout GPU,脚本见 scripts/run_deepseek_v32.py

DeepSeek 系列配方还与低精度 RL(FP8/MXFP8)、P2P 权重传输、容错恢复等高级特性配合最佳,详见 docs/models/deepseek/index.md。

Kimi:万亿参数也能训,K3 首发即支持

Kimi 家族在 Miles 上从顶到全支持:K2-Instruct / K2-Thinking、多模态智能体的 K2.5 / K2.6(均为 1T 总参数、32B 激活),以及首发(day-0)支持的Kimi-K3——KDA + MLA 混合注意力 + 896 专家潜空间 MoE。

  • K2.5 / K2.6 走INT4 QAT训练路径,先用 2-layer 冒烟测试验证环境:python scripts/run_kimi_k25.py full-train --model-name Kimi-K2.5-2layer
  • K3 采用LoRA RL(冻结基座权重、只训低秩适配器),这是让它在有限卡数上跑得动的关键,16 节点 4 卡已验证,配方见 docs/models/kimi/kimi-k3.md

💡 一句话:万亿参数模型在 Miles 上不是传说——Kimi-K2.6 的新权重可以在几秒内通过 P2P RDMA 同步到所有推理引擎。

GLM:从单节点冒烟到 744B 旗舰全覆盖

GLM 家族的 RL 训练配方覆盖每一代:GLM-4.5(106B-A12B / 355B-A32B)、紧凑的 GLM-4.7-Flash、旗舰级 GLM-5 / GLM-5.2(744B-A40B),以及 KDA + DSA 混合架构的 GLM-5.3-Flash。

  • GLM-4.7-Flash:全家族最小配方,单台 8×H100 节点即可:python scripts/run_glm47_flash.py
  • GLM-5.2(744B):完整多节点配方见 scripts/run_glm5_2_744b_a40b.py,也支持 LoRA 版 scripts/run_glm5_2_744b_a40b_lora.py

Nemotron:Mamba混合架构,免权重转换直达训练

NVIDIA 的 Nemotron-3 全系(Mamba + Attention 混合架构,Super 档还带 MoE 且原生 FP8)都通过 Megatron AutoBridge 路径加载,无需离线 HF → torch_dist 权重转换,省掉新手最容易踩坑的一步。

档位规模硬件规模
Nano(稠密)4 B单节点 8 卡,最快冒烟
Nano MoE30 B-A3B中等规模
Super(FP8 原生)120 B-A12B多节点
Ultra550 B-A55B16 节点

单节点启动命令:

python scripts/run_nemotron_3_nano.py --model-name NVIDIA-Nemotron-3-Nano-4B-BF16

配方详情见 docs/models/nemotron/index.md。

算法与硬件:跑通模型之后还有什么

RL 算法:GRPO、GSPO、PPO、REINFORCE++ 全部内置,另支持 SFT 与 on-policy 蒸馏,PPO 示例见 examples/ppo/run_qwen3_4b_ppo.py。

硬件:NVIDIA GB300 / GB200 / B300 / B200 / H200 / H100 / A100,以及 AMD MI300X / MI325 / MI350 / MI355X(ROCm)——DeepSeek-V4 Flash 还已在 AMD MI355X 上完成 RL 训练验证。

低精度训练:MXFP8、NVFP4 端到端 RL,外加 FP8、INT4 QAT、BF16、FP16,小卡预算也能训大模型,示例脚本在 examples/infra_features/low_precision/ 目录。

新手上手路径:最小成本跑通第一个RL训练

  1. 选小模型:Qwen3-4B 或 Nemotron-3-Nano-4B,单台 8 卡节点
  2. 跑冒烟测试:Kimi-K2.5 的 2-layer 变体适合先验证环境
  3. 再看指标:健康的训练运行中,rollout/raw_reward应随 rollout 稳步上升,eval 分数(如 AIME)在若干轮后明显抬升

🎯 记住这张表的选型口诀:

学框架 → Qwen3-4B;试 MoE → GLM-4.7-Flash / Qwen3-30B-A3B;上旗舰 → DeepSeek-V4 Flash、Kimi-K2.5、GLM-5.2 多节点满配。

Miles 的插件架构还允许你把任意 HuggingFace 模型包装成 Megatron 模块接入训练,意味着这份"支持模型全景图"还在持续扩展中。

【免费下载链接】milesMiles is an enterprise-facing reinforcement learning framework for LLM and VLM post-training, forked from and co-evolving with slime.项目地址: https://gitcode.com/GitHub_Trending/miles1/miles

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询