☰
Xing4.0-29B-A4B国产算力训练全解:Ascend NPU与MindSpore深度优化
2026/9/25 15:58:07 网站建设 项目流程

Xing4.0-29B-A4B国产算力训练全解:Ascend NPU与MindSpore深度优化

【免费下载链接】Xing4.0-29B-A4BXing4.0-29B-A4B 是中电信人工智能科技有限公司研发的星辰语义大模型系列(原 TeleChat)新一代模型。模型总参数量 29B,激活参数仅 4B,原生支持 256K 上下文,可扩展至 512K,是国内首个基于国产算力与国产框架完成训练、面向复杂工程任务深度优化的百亿参数大模型。项目地址: https://ai.gitcode.com/XingChen-AGI/Xing4.0-29B-A4B

Xing4.0-29B-A4B 是中电信人工智能科技有限公司研发的星辰语义大模型系列(原 TeleChat)新一代模型,总参数 29B、每 token 仅激活 4B,原生支持 256K 上下文(可扩展至 512K)。它是国内首个基于国产算力与国产框架完成训练的百亿参数大模型——全程运行在 Ascend 910C 集群上,使用 MindSpore/MindFormers 框架训练,并通过多层面深度优化将训练吞吐提升了约96%。🚀

本文带你看懂:它的架构由什么组成、国产算力上做了哪些关键优化、性能到底有多强、以及拿到模型后如何快速用起来。

规格速览:29B总参数,为什么只激活4B?

Xing4.0-29B-A4B 采用 MoE(混合专家)结构:每个 token 只激活 64 个路由专家中的 4 个(外加 1 个共享专家),因此"总参数 29B、激活参数 4B"——容量大、推理省。

配置项数值
总参数 / 激活参数29B / 4B
层数40(前 2 层为 Dense,其余为 MoE)
隐藏维度3584
路由专家 / 每 token 激活64 / 4
注意力类型MLA(多头潜在注意力)
上下文长度256K(可扩展至 512K)
词表大小131072
权重精度bfloat16

具体数值可在 config.json 中逐一核对,例如n_routed_experts: 64、num_experts_per_tok: 4、max_position_embeddings: 262144。

mHC + MLA + MTP:面向 Agent 的架构三件套

这个模型为"复杂工程任务"深度优化,核心是三项架构设计(实现见 modeling_xing4_0.py):

  • mHC(超连接残差):每层维护 4 条并行信息流(hc_mult=4),用 Sinkhorn 迭代(20 次)构造双随机组合矩阵,让残差连接"可学习、可组合",长上下文中信息保持更稳定。对应实现 Xing4_0HyperConnection,也是国产算力上开发融合算子的重点对象。
  • MLA(多头潜在注意力):把 KV 压缩到低秩隐空间(kv_lora_rank=512),显著降低长上下文的 KV 缓存显存,是 256K 长文可用的关键。见 Xing4_0Attention。
  • MTP(多 Token 预测):额外 1 个 next-n 预测层,训练时多预测下一个 token,加速推理并提升训练信号密度(configuration_xing4_0.py 中num_nextn_predict_layers=1)。

三者配合,支撑多步规划、工具调用与长链条推理——这也是它被定位为Agent-Oriented(面向智能体)架构的原因。

国产算力深度优化:96%训练吞吐是怎么来的?

Xing4.0-29B-A4B 在 Ascend 910C 集群上用 MindSpore/MindFormers 训练,并非"直接跑通",而是做了多级协同优化,整体训练吞吐相比开箱即用的表现提升约 96%:⚡

MoE 细粒度通信优化

MoE 训练最大的开销之一是专家间的 All-to-All 通信。模型对专家路由与专家计算做了细粒度切分与通信调度优化(配置中ep_size支持专家并行切分),让通信与计算充分重叠,减少 910C 集群内片间等待。

选择性重计算 + DVM 自动图算子融合

  • 选择性重计算:只对"重算成本低于存储成本"的算子启用激活重计算,在显存与算力之间取得最优平衡;
  • DVM 自动图算子融合:MindSpore 的 DVM 引擎自动把相邻小算子融合为大算子,减少片上搬运与启动开销,让 Ascend NPU 的执行图更"密实"。

Ascend C 手写 mHC 融合算子

框架自带的算子无法覆盖 mHC 这类新结构,团队使用Ascend C 编程语言手写实现了 mHC 特征适配与融合算子,把多流归一化、Sinkhorn 组合矩阵、加权求和合并为单次片上执行——这是 96% 吞吐提升中贡献最大的一环。🔧

基准实测:复杂工程任务表现突出

基准Xing4.0-29B-A4BGemma4-26B-A4BQwen3.6-35B-A3B
SWE-bench Verified75.0053.0076.00
Terminal-Bench 2.157.5030.0051.50
DeepresearchBII60.8039.3059.70
Claw-Eval76.5571.4974.54
AIME202690.0088.3092.70
SWE-bench Multilingual66.0051.0067.20

可以看到,它的优势集中在SWE-bench、Terminal-Bench、DeepresearchBII这类"真实工程场景":修 GitHub Issue、操作终端、深度检索——正是复杂工程任务优化目标的直接体现。📊

快速上手:推理部署与领域微调

推理部署:模型以 Hugging Face Transformers 格式发布(41 个权重分片,权重索引见 model.safetensors.index.json),兼容 vLLM、SGLang、KTransformers 等主流推理框架,并提供 OpenAI 兼容 API。

推荐采样参数:

场景temperaturetop_prepetition_penalty
复杂推理 / 通用任务1.00.951.05
编码 / Agent 任务0.80.951.05

领域微调:支持 LLaMA-Factory 与 MindFormers 两条路径,适合在意图分类、表格理解、合同审核、知识问答等垂直场景做轻量定制;同时已针对 OpenCode、Claude Code、OpenClaw、Hermes 等 Agent 框架做了对话格式对齐(对话模板见 chat_template.jinja,默认参数见 generation_config.json)。

仓库关键文件指引

  • README.md — 模型亮点、基准与快速上手
  • config.json — 模型结构超参数
  • configuration_xing4_0.py — 配置类定义,含张量/流水线/专家并行切分计划
  • modeling_xing4_0.py — 完整模型实现(mHC、MLA、MoE 路由)
  • tokenization_xing4_0.py + tokenizer.model — 分词器(131072 词表)
  • chat_template.jinja — 支持思考模式与工具调用的对话模板

小结

Xing4.0-29B-A4B 的意义不只是"又一个 MoE 大模型",它证明了:在 Ascend NPU + MindSpore 的纯国产技术栈上,完全可以训练出 256K 长上下文、对标国际同级模型的工程级大模型。从 MoE 通信优化、选择性重计算、DVM 图算子融合,到 Ascend C 手写融合算子,这套"框架-算子-架构"协同优化经验,对国内 AI 基础设施落地具有直接的参考价值。如果你正在评估国产算力上的大模型训练或部署方案,值得重点关注。

【免费下载链接】Xing4.0-29B-A4BXing4.0-29B-A4B 是中电信人工智能科技有限公司研发的星辰语义大模型系列(原 TeleChat)新一代模型。模型总参数量 29B,激活参数仅 4B,原生支持 256K 上下文,可扩展至 512K,是国内首个基于国产算力与国产框架完成训练、面向复杂工程任务深度优化的百亿参数大模型。项目地址: https://ai.gitcode.com/XingChen-AGI/Xing4.0-29B-A4B

创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询