GPT-6 Sol/Luna 与 Opus 5.5 同日降价:价格表里最该看的,是缓存那一行
2026/9/24 7:05:24 网站建设 项目流程

一、发生了什么

北京时间 9 月 23 日凌晨,Anthropic 与 OpenAI 同一天先后发布更便宜的模型:Anthropic 推出 Claude 5.5 系列首款 Claude Opus 5.5,OpenAI 则为 GPT-6 家族补充 GPT-6 Sol 与 GPT-6 Luna 两档(来源:两家官方发布,经 CNBC、腾讯新闻、每日经济新闻、Gulf News 交叉核对)。这也是 Anthropic CEO 阿莫代伊 9 月呼吁「放慢前沿 AI 研发」之后,该公司的首次上新。

二、技术拆解

先看价格表(标准价,美元/百万 token):

模型输入输出缓存读取相对上代
GPT-6 Sol2100.20较 GPT-5.6 促销价降 50%
GPT-6 Luna0.100.500.01输出较上代降约 58%
Claude Opus 5.54200.20单价较 Opus 5 降 20%,缓存读降 60%

三件事值得拆开看。

第一,「降 40%」和「降 20%」是两本账。Opus 5.5 的输入/输出单价只降 20%,缓存读降 60%;Anthropic 宣称的「典型工作负载成本低 40%」,是把单价下降和「完成任务用的 token 更少」乘在一起算出来的(来源:Anthropic 官方口径,腾讯新闻转述)。我在《600B 只激活 27B、成本 1/8》(https://blog.csdn.net/qq_43274490/article/details/166254348)里写过:厂商成本声明至少要拆成单价、单任务、部署三本账——这次 Anthropic 把口径写清楚了,算进步,但 40% 只在「默认设置下的测试」成立,不能当成所有账单都会少四成。

第二,降价的钱主要从缓存省出来的。两家都把缓存读取砍到远低于普通输入:OpenAI 称缓存命中单价比普通输入低 90%(Sol 缓存读 0.2 美元,Luna 低到 0.01 美元);Anthropic 缓存读从 0.50 降到 0.20 美元。这不是巧合——Agent 负载每轮循环都要重读代码库、文档和对话历史,缓存命中率直接决定实际账单。价格战的主战场悄悄从「输入/输出的门面价」挪到了「缓存单价」,等于官方盖章:行业默认负载已经是长上下文 Agent。距 Astra 发布不到三周,旗舰能力就下沉到低价档,靠的正是缓存与推理效率优化(来源:OpenAI 官方口径,每日经济新闻转述)。

第三,「降速」的实践版是安全分级,不是停更。Opus 5.5 发布前接受了 METR、Frontier Design 等外部机构测试,Anthropic 称其在测试环境中突破边界的尝试次数较 Opus 5 和 Claude Mythos 5.1 减少 85%(厂商自报,未经第三方复现);此前只配给旗舰 Fable 5.1 的网络安全与生物高风险保障,这次直接下放到 Opus 档。能力迭代照跑、价格往下打、安全变成可对外讲的分级体系——「放慢前沿」落地之后长这样。我在《读懂 Anthropic 这份「AI 自研仪表盘」》(https://blog.csdn.net/qq_43274490/article/details/166012672)里提过,他们家的对外叙事一向指标先行,这次又添了一条。

三、我的判断

  1. 降价压力大概率来自开源侧。最近一周阶跃 Step 5、三元压缩 27B、小米 MiMo-V2.6 开源接连把「单位能力成本」往下压,闭源双雄在同一天比谁更便宜,时间点不像巧合。开源与闭源的竞争已经从跑分榜挪到了账单上。
  2. 这一轮卖的是 Agent 经济,不是聊天。Sol 定位编码与 Agent 任务,Luna 定位高吞吐量抽取与摘要,两家新品全部冲着自动化工作负载去。Anthropic 自己也提醒,跑分差距已不总能反映实际使用差距——接下来选型的关键数字会从「基准分」变成「每任务成本」。
  3. 要提防的坑:所有百分比都是厂商口径。OpenAI 称 Sol 在内部事实性评估中错误率约为 GPT-5.6 Sol 的一半,还给出 AutomationBench 单任务成本约为 Opus 5 的 1/11 的对比——全部来自 OpenAI 自己的测试,没有第三方复现。单价、缓存、token 效率、任务定义,任何一个变量都能把 40% 变成 15%,也能变成 60%。别拿宣传数字直接做预算。
  4. 免费档也在下探。Luna 向 Free/Go 用户开放桌面端体验,Sonnet 5.5 / Haiku 5.5 几周内跟进,中档价位后面还会再挤一次水。

四、对开发者的启示

重算你的账单结构:如果在跑 Agent 类负载,把「缓存命中率 × 缓存单价」单独拎出来,它现在比输入/输出单价更值得优化。一个可以直接跑的敏感性计算:

# 缓存命中率对 Agent 月账单的敏感性(以 Sol 为例)price_input,price_cache=2.0,0.20# 美元/百万 tokenmonthly_input_tokens=300*1e6# 每月 3 亿输入 tokenforhit_ratein(0.0,0.5,0.8,0.9):cost=monthly_input_tokens/1e6*(hit_rate*price_cache+(1-hit_rate)*price_input)print(f"缓存命中率{hit_rate:.0%}-> 月输入成本 ${cost:,.0f}")# 0%: $600 / 50%: $310 / 80%: $172 / 90%: $118

同样的负载,命中率从 0 提到 90%,账单差 5 倍——这就是两家拼命降缓存价的直接原因。选型时别只比门面单价,拿你自己的负载画像去套价格表,结论经常和跑分榜相反。

上周我在《本周 AI 观察:嘴上喊着降速,手上全踩油门》(https://blog.csdn.net/qq_43274490/article/details/165889577)里说「话语踩刹车、产品踩油门」,这次两家直接把油门换成了价格表;开源侧那条成本线,此前在《98.2% 是真的,但先看它把 1.8% 藏在哪》(https://blog.csdn.net/qq_43274490/article/details/166140327)里拆过一遍,可以连起来读。

这个专栏每天一篇 AI 解读,关注不迷路。

你们现在的 Agent 账单里,缓存命中能占到几成?评论区报个数。


专注 AI 工程化实践与出海外贸技术

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询