最近很火的miniCPM5系列的那个23分其实厂家本身做了多次迭代
2026/9/14 23:36:41 网站建设 项目流程


MiniCPM5 那个 23 分,厂商自己改了三遍

你大概率在热搜或群里见过这句话:MiniCPM5-2B,"海外一个评测榜(圈里叫 AA)上拿了 23 分,4B 以下登顶"。

但有个细节几乎没人提:这个分数,厂商自己都改过三次。

那个海外榜(Artificial Analysis,圈里叫 AA)自己写明了:v4.1.1 版本是23 分;更新到 v4.2 降到15 分;再到 v4.3 只有14 分,已经和谷歌的 Gemma 4 12B打平,而不是官方宣传的"超越"。AA 还专门声明:两个版本的分不能直接比。

也就是说,你转的那条"23 分登顶",已经是过期版本号了。可中文媒体(包括厂商自己的页面)还在复读 23 分。

MiniCPM5 没有官方 API,也没有任何第三方托管服务能直接调,想用现成的拉取命令(比如 ollama pull)?库里根本没这个模型,链接都是 404,想用,只能自己部署。云端调不了,一手数据只能自己跑出来。

于是我们干了。


一、它到底是什么(带口径的官方数据)

MiniCPM5 是面壁(OpenBMB)9 月初开源的、能跑在本地设备上的模型系列,两个成员:

  • 1B:约 10.8 亿参数,Apache 2.0 协议,能直接商用

  • 2B:约 25.2 亿参数,同样 Apache 2.0 可商用

它的"骨架"是标准 Llama 架构,没有自己发明的奇怪算子:42 层、2048 维、16 个"提问头" +2 个"记忆头"(KV 头)、13 万词表、原生支持 128K 长度的上下文。我们把参数从配置文件反推了一遍,零误差,和官方数字基本对得上,手上是原版结构,没缩水。

官方自己测了 34 项基准,平均53.9 分,但那是对比题是厂商自己挑的。引用时请标"厂商自测",有第三方(OrcaRouter)指出,其中 SWE-bench 那行 46.4 分、平均 53.9 这两行,至今没人逐题复现过。

下面这几句,写文章时一条都别碰(都是被实测打脸过的坑):

  • ❌ 只写"AA 23 分"不带版本号(那已经是旧版)

  • ❌ 把"512K 上下文"当它的原生能力(配置里写死的是 131072,512K 是营销口径)

  • ❌ 说它"多模态"能看图(纯文本模型)

  • ❌ "ollama pull minicpm5 一键拉取"(库 404,假命令)

  • ❌ "超越 Gemma 4 12B"(v4.3 下是持平)


二、别人测了什么(谁的话能信)

这是本系列核心的差异化,中文内容 9 成在复读通稿,几乎没人做一手实测。盘点一下已有的测评,按可信度分三档:

🟢能直接引用

  • AA 官方文章:版本漂移(23→15→14)的出处,有力第三方背书

  • FlagOS 技术稿:在苹果 M5 Pro 上,用 W4A8 / W8A8 比 llama.cpp 的 Q4_0 / Q8_0,读取速度 +19% / +32%,少有的条件完整的第三方性能对比

  • 日本 GIGAZINE:引了 AA v4.3 = 14 分

🟡方法能学,结论别引

  • LM Studio 社区:在 RTX 5080 上跑了三个"带陷阱"的用例,"结论全合格",但没给量化指标、也没列失败案例

  • logeshwaran.org:老实承认"没有 2B 的速度数据,不会编一个",态度好,但给的是上界推测

  • 七牛 / 掘金:部署命令是准的,性能数字都是转述官方

🔴别信(AI 洗稿号)

  • ai-cost-estimator:至少 4 处硬伤(说它多模态、8K 上下文、ollama 能拉、2.1B 参数,全错)

  • 某些 CSDN 稿:参数表对,但"RTX 4090 上 Q4_K_M 50-100 t/s"没任何实测出处


三、我们测了什么(接下来几篇测给你看)

我们把 MiniCPM5 在主力机(R9-7900 处理器 + RTX 3070 8G 显卡 + 64G 内存)上跑了 200+ 轮,全是本地一手数据:

测的什么

规模

回答的问题

裸模型聊天

59 题 × 4 档 × 2 种口径 × 3 轮 = 1416 轮

能力水位在哪

自动干活外壳(opencode)

13 题 × 4 档 × 3 轮 = 156 轮

1B 聊天能拿 49%,放进外壳却 0/13

长上下文 needle

8k~112k

实测天花板 12.3 万 token

超时敏感性

3 道长题 × 3 组对照 = 9 轮

"加超时能救活长任务吗"(答案是不能)


四、系列目录(追更路线)

  1. 总纲(本篇):情报综述 + 我们的计划

  2. 自动干活的地板是 2B:1B 聊天 49%,放进外壳直接归零(文末附"我们怎么测的")

  3. 12 万 token 能吃吗:2 个记忆头给的红利,和一道采集口径的坑

  4. 实际建议:能力边界与量化选择(聊天 / 文档 / 代码 / 自动干活 / 写作 + Q4 vs F16)

  5. 收尾对比:MiniCPM5 vs 上一季的 SparkX25,能耐差在哪

数据口径:本篇官方数据来自 openbmb.cn 官方页(标注"厂商自测");版本漂移来自 AA 官方文章 + GIGAZINE;我们的实测都在 RTX3070-8G下完成,后续 4 篇逐题展开。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询