35B 单挑万亿:Intern-S2-Preview 与 Intern-S1-Pro 的差距还剩多少
【免费下载链接】Intern-S2-397B项目地址: https://ai.gitcode.com/InternLM/Intern-S2-397B
2026 年 WAIC 上,上海人工智能实验室以"397B 参数追平万亿模型"的表述发布了科学智能体新基座 Intern-S2,围绕它的社区讨论很快被一个更尖锐的问题占据:一个激活参数只有 35B 的模型,凭什么敢去对标万亿级的 Intern-S1-Pro?更值得追问的是——在数学、材料、物理这些硬核科学任务上,35B 与万亿的差距究竟是被抹平了,还是仅仅被"藏"了起来?本文不打算停留在宣传口径上,而是结合社区公开评测与仓库源码(架构配置、权重索引、分词器、部署指南),把这笔账算清楚。
先厘清一个数字:35B、397B 与"万亿"分别指什么
围绕 Intern-S2 的讨论中,"35B"和"397B"两个数字经常混用,其实它们指代的是同一款模型的两套口径。打开仓库根目录的 config.json 可以看到:
- 架构类型为
Qwen3_5MoeForConditionalGeneration,即 MoE(混合专家)架构; - 文本主干共 60 层,
hidden_size为 4096; - 每层拥有512 个专家(
num_experts: 512),但每次推理只激活其中10 个(num_experts_per_tok: 10),另有 1 个共享专家; - 词表 251392,原生最大上下文 262144(256K)。
按照 512 专家 × 每专家约 1260 万参数(1024 的中间维度 × 4096 的隐维度 × 3 个投影矩阵)估算,总参数落在 397B 量级;而每次 token 只经过 10 个专家 + 共享专家 + 注意力,实际激活参数约 35B。这正是社区文章反复强调"350 亿参数"的由来——它描述的不是模型体积,而是单次推理的真实算力开销。仓库中的 model.safetensors.index.json 也从权重侧印证了规模:全量权重约 806GB(bfloat16),被切分为 188 个分片。
与之对比的 Intern-S1-Pro 则是社区口径中的"万亿级"模型。所以这场对决的准确表述是:总参数 397B、激活参数 35B 的 Intern-S2-Preview,去追赶总参数近万亿的 Intern-S1-Pro。参数差出两个数量级,比的却是同一份科学任务榜单——这本身就是 MoE 时代"稀疏激活"叙事最有戏剧性的注脚。
两代模型架构差异总览:同源配方,更极致的分工
从架构配置看,Intern-S2-Preview 不是另起炉灶,而是在 Intern-S1 的技术路线上做了三处关键升级,每一处都能在仓库配置里找到实锤。
第一处:注意力机制的分层混合。config.json 的layer_types字段揭示了 60 层网络的真实排布:以 4 层为一组,前 3 层是linear_attention(线性注意力),第 4 层是full_attention(全注意力),如此循环。全注意力层负责全局信息的精确检索,线性注意力层负责长序列的高效压缩,两者以 3:1 的比例交错,配合full_attention_interval: 4的设定,让模型在 256K 长上下文下依然可控算力。
第二处:MTP 多 token 预测头。mtp_num_hidden_layers: 1表明模型内置了单层 MTP(Multi-Token Prediction)模块,权重索引中也确实存在mtp.*的完整参数组。MTP 让模型在解码阶段一次预测多个 token,再由部署框架做推测解码校验。deployment_guide.md 中 LMDeploy 的启动参数--speculative-algorithm qwen3_5_mtp --speculative-num-draft-tokens 4以及 SGLang 的NEXTN配置,都是为这个预测头服务的。
第三处:科学模态的原生分词。这是与 Intern-S1 最显著的能力分野。tokenizer_config.json 中可以看到三类专用子词表:SMILES(分子结构式,offset 248102)、PROT(蛋白质序列,offset 249126)、XNA(核酸序列,offset 250150),配合 tokenization_interns1.py 中的自动检测逻辑(<SMILES_AUTO_DETECT>/<PROT_AUTO_DETECT>/<XNA_AUTO_DETECT>),模型无需提示即可识别并正确编码分子式、蛋白序列和 DNA/RNA 串。此外还有TS_CONTEXT/TS_GEN时间序列标记与<tool_call>工具调用标记,构成完整的科学智能体 token 生态。
两代模型的差异可以总结为下表:
| 维度 | Intern-S2-Preview | Intern-S1-Pro(社区口径) |
|---|---|---|
| 总参数量 | 397B(MoE) | 约万亿级 |
| 激活参数 | 约 35B | 显著更大 |
| 专家配置 | 512 专家 / 激活 10 | 大规模 MoE |
| 注意力 | 线性注意力 + 全注意力 3:1 混合 | 以全注意力为主 |
| 原生上下文 | 256K(YaRN 可扩至 512K+) | 长上下文 |
| 科学模态 | SMILES / PROT / XNA / 时间序列原生分词 | 依赖文本表示 |
| MTP 预测头 | 内置(1 层) | 视版本而定 |
其中"科学模态原生分词"是 35B 敢于叫板万亿最硬的底气:它把分子式、蛋白质序列这类科学任务的"语法"直接焊进了词表,而不是让模型在通用 token 上重新摸索。
数学、材料、物理三域逐项对比:领先在哪里
社区公开评测与实测文章提供了三域对比的清晰证据,且与仓库能力设计一一对应。
数学:用更少的 token 拿更高的分。社区评测普遍反映,Intern-S2-Preview 在复杂数学基准上展现出突出的"推理效率"——即同样一道题,它以更短的思维链和更少的输出 token 完成解答。这要归功于训练阶段对 CoT 的压缩式 RL 强化(社区情报所称"MTP 与 CoT 压缩的高效 RL 推理")。在 README.md 的"思考/非思考模式切换"示例中,模型通过enable_thinking参数动态开关推理链,也印证了其在"想得深"与"说得短"之间的工程化平衡。
材料:首次在开源通用模型里生成晶体结构。这是三域对比中差距被拉开得最明显的一项。社区情报显示:Intern-S2-Preview 在 MolecularIQ 评测中拿到 57.26 分,超过 Gemini-3.1-Pro;在晶体结构生成任务上,结构通过率超过 40%,显著优于 GPT-5.5,并且是首个在开源通用大模型中实现材料晶体结构生成、支持高精度坐标回归的模型。SMILES 分词器与工具调用协议在这里直接兑现了价值——模型不仅能"读懂"分子式,还能以坐标形式"生成"新材料,这正是材料科学智能体的核心场景。
物理:原生时间序列建模把"物理感知"内置化。物理任务的对比重点不在参数而在模态。README.md 的 Time Series Demo 展示了两个典型用例:从地震波形信号中判定事件并定位 P 波/S 波起振时刻;基于历史电力负荷与气象数据预测未来 48 个时点的负荷曲线。<|ts|>标记、encode_time_series_base64编码接口以及enable_forecasting请求参数,构成了从数据编码到数值预测的完整链路。社区实测进一步确认:这类任务上,35B 模型的表现已能与万亿级模型互有胜负,尤其在"信号理解 + 数值输出"这类对模态对齐要求极高的场景。
上图来自 README.md 的官方性能对比(评估工具为 OpenCompass / VLMEvalKit / AgentCompass;下划线代表开源模型最佳,加粗代表全体模型最佳)。可以看到,科学类基准(材料、生物、科学编程)是 S2 拉开身位的重点区域,这正是"任务 Scaling"的直接收益:模型在超过 20 个科学领域的 RL 任务上联合训练,把有限参数的每一点容量都花在了刀刃上。
35B 逼近万亿的边界在哪:什么任务仍吃力
领先是局部的,差距也是局部的。把三域的胜利拆开看,能清晰看到 35B 模型的"能力边界"与"成本边界"。
推理效率红利是真实的。社区在 8×H200 + SGLang 环境下的实测显示:开启 MTP 后,输出长度 16000 token 时吞吐提升可达 97.52%,延迟降低约 61%,且 Accept Length(推测接受长度)随输出增长而提高。这意味着同样的算力预算下,35B 激活模型能服务的科学 Agent 会话数是万亿级模型难以企及的——效率本身就是科学场景下的一种能力,尤其是面对长文档、长时序、多轮工具调用这类高频长输出任务。
但 35B 的"知识容量"是硬上限。激活参数少,意味着模型在单次前向中能携带的"记忆"少。社区评测与官方表述都保留了一致的分寸:Intern-S2-397B 的定位是"在显著提升科学推理与智能体能力的同时保持通用能力"——注意是"保持"而非"全面超越"。这意味着:
- 开放域长尾知识类任务仍会是万亿模型的优势场。稀有化合物常识、跨语种低资源语料、需要"背下来"而非"推出来"的事实性问答,靠的是参数里的存量,而这恰恰是 35B 激活的短板;
- 多模态长上下文的高强度推理仍昂贵。虽然原生 256K 上下文是亮点,但 deployment_guide.md 明确要求 8×H100/H200 节点起步,全量权重 806GB、512k 长上下文需配合 YaRN RoPE 配置(
factor: 4.0)——部署门槛不低,个人研究者复现成本仍然可观; - 智能体任务的稳定性依赖外围工程。官方在 README.md 中特意提示"不建议在智能体任务中关闭思考模式",且工具调用需匹配
--tool-call-parser interns2-preview等框架参数——这说明 Agent 场景下,模型的强项必须依赖推理框架与提示协议的配合才能兑现,脱离工程环境裸跑,35B 与万亿的差距会被重新放大。
结论:参数差距没有被抹平,但赛道被重新定义了
把账算完,问题的答案比宣传口径更冷静:35B 没有"追平"万亿,它只是把竞争从"谁的参数多"搬到了"谁的 token 用得聪明"。在数学推理效率、材料结构生成、物理时序建模这些科学任务上,任务 Scaling + RL + 原生科学模态的组合让 397B 总参数(35B 激活)的模型打出了远超参数比例的战斗力;而在开放域知识密度、事实性长尾问答这类"靠容量吃饭"的任务上,万亿级模型的身位依然稳固。
对研究者而言,这场对比最大的启示不是"小模型打败大模型",而是 MoE 稀疏激活 + 科学任务定向 Scaling 提供了一条可复制的路径:把参数花在模态上(SMILES/PROT/XNA/时序)、把效率押在架构上(线性注意力 + MTP)、把能力锁定在任务上(多域 RL 联合训练)。35B 与万亿的差距还剩多少?答案写在 config.json 的每一行配置里,也写在 deployment_guide.md 的每一段启动参数里——它已经不再是"差 28 倍参数"这么简单,而是"差一个科学的赛道定义"。
【免费下载链接】Intern-S2-397B项目地址: https://ai.gitcode.com/InternLM/Intern-S2-397B
创作声明:本文部分内容由AI辅助生成(AIGC),仅供参考