Xing4.0-29B-A4B国产算力训练全解:Ascend NPU与MindSpore深度优化
【免费下载链接】Xing4.0-29B-A4BXing4.0-29B-A4B 是中电信人工智能科技有限公司研发的星辰语义大模型系列(原 TeleChat)新一代模型。模型总参数量 29B,激活参数仅 4B,原生支持 256K 上下文,可扩展至 512K,是国内首个基于国产算力与国产框架完成训练、面向复杂工程任务深度优化的百亿参数大模型。项目地址: https://ai.gitcode.com/XingChen-AGI/Xing4.0-29B-A4B
Xing4.0-29B-A4B 是中电信人工智能科技有限公司研发的星辰语义大模型系列(原 TeleChat)新一代模型,总参数 29B、每 token 仅激活 4B,原生支持 256K 上下文(可扩展至 512K)。它是国内首个基于国产算力与国产框架完成训练的百亿参数大模型——全程运行在 Ascend 910C 集群上,使用 MindSpore/MindFormers 框架训练,并通过多层面深度优化将训练吞吐提升了约96%。🚀
本文带你看懂:它的架构由什么组成、国产算力上做了哪些关键优化、性能到底有多强、以及拿到模型后如何快速用起来。
规格速览:29B总参数,为什么只激活4B?
Xing4.0-29B-A4B 采用 MoE(混合专家)结构:每个 token 只激活 64 个路由专家中的 4 个(外加 1 个共享专家),因此"总参数 29B、激活参数 4B"——容量大、推理省。
| 配置项 | 数值 |
|---|---|
| 总参数 / 激活参数 | 29B / 4B |
| 层数 | 40(前 2 层为 Dense,其余为 MoE) |
| 隐藏维度 | 3584 |
| 路由专家 / 每 token 激活 | 64 / 4 |
| 注意力类型 | MLA(多头潜在注意力) |
| 上下文长度 | 256K(可扩展至 512K) |
| 词表大小 | 131072 |
| 权重精度 | bfloat16 |
具体数值可在 config.json 中逐一核对,例如n_routed_experts: 64、num_experts_per_tok: 4、max_position_embeddings: 262144。
mHC + MLA + MTP:面向 Agent 的架构三件套
这个模型为"复杂工程任务"深度优化,核心是三项架构设计(实现见 modeling_xing4_0.py):
- mHC(超连接残差):每层维护 4 条并行信息流(
hc_mult=4),用 Sinkhorn 迭代(20 次)构造双随机组合矩阵,让残差连接"可学习、可组合",长上下文中信息保持更稳定。对应实现 Xing4_0HyperConnection,也是国产算力上开发融合算子的重点对象。 - MLA(多头潜在注意力):把 KV 压缩到低秩隐空间(
kv_lora_rank=512),显著降低长上下文的 KV 缓存显存,是 256K 长文可用的关键。见 Xing4_0Attention。 - MTP(多 Token 预测):额外 1 个 next-n 预测层,训练时多预测下一个 token,加速推理并提升训练信号密度(configuration_xing4_0.py 中
num_nextn_predict_layers=1)。
三者配合,支撑多步规划、工具调用与长链条推理——这也是它被定位为Agent-Oriented(面向智能体)架构的原因。
国产算力深度优化:96%训练吞吐是怎么来的?
Xing4.0-29B-A4B 在 Ascend 910C 集群上用 MindSpore/MindFormers 训练,并非"直接跑通",而是做了多级协同优化,整体训练吞吐相比开箱即用的表现提升约 96%:⚡
MoE 细粒度通信优化
MoE 训练最大的开销之一是专家间的 All-to-All 通信。模型对专家路由与专家计算做了细粒度切分与通信调度优化(配置中ep_size支持专家并行切分),让通信与计算充分重叠,减少 910C 集群内片间等待。
选择性重计算 + DVM 自动图算子融合
- 选择性重计算:只对"重算成本低于存储成本"的算子启用激活重计算,在显存与算力之间取得最优平衡;
- DVM 自动图算子融合:MindSpore 的 DVM 引擎自动把相邻小算子融合为大算子,减少片上搬运与启动开销,让 Ascend NPU 的执行图更"密实"。
Ascend C 手写 mHC 融合算子
框架自带的算子无法覆盖 mHC 这类新结构,团队使用Ascend C 编程语言手写实现了 mHC 特征适配与融合算子,把多流归一化、Sinkhorn 组合矩阵、加权求和合并为单次片上执行——这是 96% 吞吐提升中贡献最大的一环。🔧
基准实测:复杂工程任务表现突出
| 基准 | Xing4.0-29B-A4B | Gemma4-26B-A4B | Qwen3.6-35B-A3B |
|---|---|---|---|
| SWE-bench Verified | 75.00 | 53.00 | 76.00 |
| Terminal-Bench 2.1 | 57.50 | 30.00 | 51.50 |
| DeepresearchBII | 60.80 | 39.30 | 59.70 |
| Claw-Eval | 76.55 | 71.49 | 74.54 |
| AIME2026 | 90.00 | 88.30 | 92.70 |
| SWE-bench Multilingual | 66.00 | 51.00 | 67.20 |
可以看到,它的优势集中在SWE-bench、Terminal-Bench、DeepresearchBII这类"真实工程场景":修 GitHub Issue、操作终端、深度检索——正是复杂工程任务优化目标的直接体现。📊
快速上手:推理部署与领域微调
推理部署:模型以 Hugging Face Transformers 格式发布(41 个权重分片,权重索引见 model.safetensors.index.json),兼容 vLLM、SGLang、KTransformers 等主流推理框架,并提供 OpenAI 兼容 API。
推荐采样参数:
| 场景 | temperature | top_p | repetition_penalty |
|---|---|---|---|
| 复杂推理 / 通用任务 | 1.0 | 0.95 | 1.05 |
| 编码 / Agent 任务 | 0.8 | 0.95 | 1.05 |
领域微调:支持 LLaMA-Factory 与 MindFormers 两条路径,适合在意图分类、表格理解、合同审核、知识问答等垂直场景做轻量定制;同时已针对 OpenCode、Claude Code、OpenClaw、Hermes 等 Agent 框架做了对话格式对齐(对话模板见 chat_template.jinja,默认参数见 generation_config.json)。
仓库关键文件指引
- README.md — 模型亮点、基准与快速上手
- config.json — 模型结构超参数
- configuration_xing4_0.py — 配置类定义,含张量/流水线/专家并行切分计划
- modeling_xing4_0.py — 完整模型实现(mHC、MLA、MoE 路由)
- tokenization_xing4_0.py + tokenizer.model — 分词器(131072 词表)
- chat_template.jinja — 支持思考模式与工具调用的对话模板
小结
Xing4.0-29B-A4B 的意义不只是"又一个 MoE 大模型",它证明了:在 Ascend NPU + MindSpore 的纯国产技术栈上,完全可以训练出 256K 长上下文、对标国际同级模型的工程级大模型。从 MoE 通信优化、选择性重计算、DVM 图算子融合,到 Ascend C 手写融合算子,这套"框架-算子-架构"协同优化经验,对国内 AI 基础设施落地具有直接的参考价值。如果你正在评估国产算力上的大模型训练或部署方案,值得重点关注。
【免费下载链接】Xing4.0-29B-A4BXing4.0-29B-A4B 是中电信人工智能科技有限公司研发的星辰语义大模型系列(原 TeleChat)新一代模型。模型总参数量 29B,激活参数仅 4B,原生支持 256K 上下文,可扩展至 512K,是国内首个基于国产算力与国产框架完成训练、面向复杂工程任务深度优化的百亿参数大模型。项目地址: https://ai.gitcode.com/XingChen-AGI/Xing4.0-29B-A4B
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考