☰
9月开源大模型密集更新:总参数在涨,激活参数和单位成本却在降
2026/9/29 1:35:44 网站建设 项目流程

9月的这波大模型更新,如果只看榜单分数,会觉得又是熟悉的"发布周"套路。但把几个国产开源模型放在一起看,会看到一个更实在的变化:总参数越做越大,每次推理真正激活的参数却越来越小;与此同时,API 的单位成本在往下走,缓存命中的价格甚至被砍到了原来的四分之一。对开发者来说,这比"某模型又刷新了某个基准"有用得多。

一、这波更新到底改了什么

先摆几条有据可查的事实(数据均来自公开报道与厂商文档,仅供了解趋势):

  • 智谱 GLM-5.3-Flash:GLM-5 系列首个原生多模态模型,总参数量约 320B,采用 MoE 架构,每次推理激活约 18B,权重以 MIT 许可证在 Hugging Face 开源,API 同步开放。据报道,它在正式揭面前曾以匿名代号在 OpenRouter 上冲上过调用量榜首。
    • 阿里 Qwen3.8-Flash-Next:被官方描述为下一代架构的预览版本,据第三方报道约为 125B 总参数、6B 激活,主打稀疏注意力、门控残差一类的效率改进,第三方盘点给出的 API 价格约为每百万 token 输入 1 元、输出 3 元。
    • Anthropic:9 月发布新模型时把提示缓存读取的价格下调了约 75%,从此前每百万 token 1 美元降到 0.25 美元(标准输入价未变,缓存读取价单独下调)。
      把这三条放在一起,方向就很清楚了:竞争的主战场,正在从"谁的参数大、谁的分高",转向"谁能让单位任务更便宜、更快、更稳"。

二、技术本质:MoE 把"大"和"贵"解耦了

过去大家默认一条公式:参数越大 → 能力越强 → 推理越贵。MoE(混合专家)把这个链条拆开了。

MoE 的核心思路是:模型里塞很多"专家"子网络,但每次 token 只路由到其中少数几个。于是总参数量决定模型的知识容量(存得下多少东西),激活参数量决定每次推理的计算量(跑一次要花多少钱)。320B 总参数、18B 激活,意味着"知识面按大模型来配,账单按小模型来结"。

这解释了两个现象:

  1. 为什么小激活参数的模型也能打。6B 激活对上一个 300 多 B 的模型,单看计算量是小一个数量级,但因为专家库够大、训练数据够多,实际表现并不差。这里的关键不在"参数多少",而在路由策略和专家利用率做得好不好。
    1. 为什么成本能压下来。推理成本大致正比于激活参数数量和输出 token 数量。激活参数一降,单位成本自然跟着降;再叠加缓存降价,长对话、长文档这类场景的实际开销掉得更快。
      没变的是什么?一是碎片化。不同厂商的许可证并不统一——同样是"开源",MIT 和自定义社区许可在商用、二次分发上的限制差别很大。二是"开源"这两个字的含金量在缩水,不少厂商只放权重、不放训练细节,甚至放出的是上一代版本。三是评测分数依然不能直接换算成你业务里的效果。

三、对开发者意味着什么,以及几个真实的坑

第一,选型要算"单位任务成本",不是单 token 价格。单价低的模型如果为了想清楚问题而输出一堆"思考过程",总账可能反而更贵。据公开报道,就有新模型在把缓存价格砍掉 75% 的同时,因为输出 token 变多,单个复杂任务的总成本反而比上一代高了约 20%。所以看价目表时要同时盯住三个量:输入价、输出价、以及平均输出 token 数。

下面这段代码可以拿来粗算一个场景的单位成本(价格换成你自己拿到的价目表即可):

defcost_per_task(input_tokens,output_tokens,cached_tokens,price_in,price_out,price_cached):"""price_* 单位:元 / 百万 token;cached_tokens 为命中缓存的部分"""non_cached=max(input_tokens-cached_tokens,0)return(non_cached/1e6*price_in+cached_tokens/1e6*price_cached++output_tokens/1e6*price_out+)# 同一个任务,两个模型的对比(数字为示意,请替换为实际价目表)a=cost_per_task(8000,1500,6000,price_in=5,price_out=25,price_cached=0.25)b=cost_per_task(8000,3000,6000,price_in=1,price_out=3,price_cached=0.1)print(f"A 模型单任务约{a:.4f}元,B 模型单任务约{b:.4f}元")

第二,有缓存就用缓存,但要理解缓存的语义。缓存省钱的前提是"前缀稳定":系统提示词、工具定义、长文档这些基本不变的部分放在前面,把变化的部分放后面。反过来,如果你每次都把不同的用户输入塞在最前面,缓存基本命中不了。另外注意缓存的有效期——某些服务在调整 TTL 后,实际命中率会明显下降,省的钱就没那么多了。

第三,看清许可证再动手。想私有化部署、想封装成产品对外提供服务的,一定先确认许可证:MIT 类通常宽松,但社区许可往往要求"提供 MaaS 或编程助手类产品需另行申请商业许可"。这一步踩坑,后面很难补救。

第四,本地跑得动,才是真便宜。一个 27B 左右的模型 4-bit 量化后大约 19GB,能在 24GB 内存的机器上跑起来。对数据敏感、调用量稳定的场景,本地部署省下的不只是 API 费,还有合规风险。

四、收个尾

这波更新里最值得记住的不是某个模型的名字,而是那条持续了几年的成本曲线:能力在涨,单位成本在掉。对开发者来说,这既是机会也是负担——可选项多了,选错的代价也分散在每一天的账单里。与其追榜单,不如拿自己真实的几个任务跑一遍:算算单位成本、看看稳定性、确认许可证。

你现在项目里主力用的是哪个模型?有没有因为"输出 token 变多"被账单反杀的经历?评论区聊聊。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询