10月8日,JetBrains 把新模型 Mellum2.1 挂上了 Hugging Face。12B 的参数规模,每次推理只叫醒其中 2.5B,许可证还是 Apache 2.0。
架构和上一代 Mellum2 一样,JetBrains 动的是训练流程:强化学习从收尾环节被挪成了训练主体。剩下两个数字更值得记:高负载推理吞吐接近 Qwen3.5-9B 的两倍,单请求速度提升约 1.6 倍。翻译成日常一点的话,同一张显卡能同时喂饱的编程助手变多了。
升级动在了训练阶段
Mellum2.1 延续 Mellum2 的 12B 混合专家架构,活跃参数 2.5B,许可证仍是 Apache 2.0。架构没变,变的是训练。
JetBrains 把强化学习从原来的短期收尾扩展成了训练主体,并在数学、算法竞赛、科学、工具调用和软件工程几个方向补了训练数据。撑起这套训练的是内部搭的强化学习环境,训练期间启动过数百万个沙盒,覆盖数千个环境。
数据在进炉子之前也被筛过一遍。测试本身有缺陷的、答案没法验证的、难度明显不对的任务,都被剔掉了。
能力上的变化是具体的:升级后的模型会自己翻代码库、改文件、回头检查自己的改动,也能找到失败测试的根因,起草修复方案,再跑一遍验证结果。JetBrains 说最大的改进就落在这类智能体编程任务上。
2.5B 干活,12B 兜底
混合专家的做法是让模型带着 12B 的知识量,但在处理一个 token 时只叫醒 2.5B 去算。
算力账单按 2.5B 付,不按 12B 付,同一张显卡因此能塞进更大的批量。JetBrains 把 Mellum2.1 和 Mellum2、Qwen3.5-9B、Gemma 4 E4B 放在同一套评测设置下比,高负载推理时 Mellum2.1 的吞吐 token 数接近 Qwen3.5-9B 的两倍。
另一个细节是多了个多 Token 预测,也就是 MTP,模型一次往下猜多个 to