GPT-6 Sol 发布当天,OpenAI 给出的口径是"错误约减半、价格减半"。一天后,Artificial Analysis 的独立评测出来了——这份评测的价值在于,它既确认了 OpenAI 没吹的部分,也把没说的代价摆了出来。
先给结论:Sol 是一次很扎实的发布,但它最引人注目的幻觉率下降,有一部分是靠"少回答"实现的。
一、第三方确认的部分
GPT-6 Sol (max) vs GPT-5.6 Sol (max)(Artificial Analysis 实测)
| 定价 | $2/$10,较前代减半 |
| 智力指数 | 与前代持平 |
| 编码代理指数 | 57,上升 2 分 |
| Terminal-Bench 4.0 | 43% vs 37% |
| SWE-Atlas-QnA | 58% vs 54% |
| 单任务成本(智力指数) | $1.06 vs $1.99,约省一半 |
| 单任务成本(编码代理) | $2.99,约省一半,位于 Pareto 前沿 |
"智力指数持平、编码代理上升 2 分、成本减半"——这三行连起来读,才是这次发布的准确定义:不是能力跃迁,是把同等能力便宜一半地重新上市。AA 的判断是 Sol 占据了 Coding Agent 指数 vs 单任务成本的 Pareto 前沿,这个说法我认同。
还有一个容易被忽略的细节:Sol 每任务多用了输出 token(31k vs 29k)。也就是说,成本下降完全来自单价,不是来自它变得更省 token。这一点和 Opus 5.5"省 token 又降价"的路线恰好相反。
二、幻觉率 92% → 60%:好事,但要看清机制
AA-Omniscience(知识与幻觉基准)的数据最扎眼:
AA-Omniscience 幻觉变化
| 幻觉率 | 92% → 60% |
| 答题尝试率 | 99% → 83% |
| 错误答案数 | 减少约四分之一 |
| 答题准确率 | 59% → 54%(反而降 5 分) |
| AA-Omniscience 指数 | 22 → 27 |
把这五行放在一起,机制就清楚了:Sol 幻觉变少,主要不是因为它"知道得更多",而是因为它"更敢说不知道"。尝试率从 99% 掉到 83%——那 16% 不再硬编的题,原本大部分是幻觉重灾区。
我对这件事的看法是正面的,但要纠正一个流行误读:这不是"准确性提升 32 个点",而是"不确定性处理变好了"。在 QA 型产品里这是巨大进步;但在知识密集型工作里,那 5 分的准确率下降意味着你遇到的"自信的错误"比例可能没怎么变——只是总量少了。
Luna 的同款数据也顺手列一下:幻觉率 93% → 77%,准确率 44% 基本持平,Omniscience 指数从 -10(是的,负分)到 1。
三、第三方指出的两处退步
这次评测最有价值的信息其实是退步项,OpenAI 的发布材料里没有提:
- GDPval-AA v2.1(覆盖 44 个职业的经济价值任务基准):Sol 掉了约 100 Elo,Luna 掉约 75;
- AA-Briefcase v1.1(跨数周的知识工作项目、数千输入文件的私有评测):Luna 掉约 45 Elo,Sol 持平。
AA 团队人工检查了数百个输出后给出的归因是:交付物变短了,展示质量下降,更常漏掉评分项要求的要素。
这个发现对实际选型很重要。如果你的场景是"生成报告、方案、长文档"这类知识交付物,Sol 的退步是真实存在的;如果只是编码和 Agent 调用,则不受影响。这也是我一直建议用自己的评测集而不是榜单做决策的原因——榜单的均值会把这些结构性差异抹平。
四、缓存重设计:被低估的另一半
这次降价 OpenAI 归因于缓存与推理改进,其中缓存部分有实料:
- 改变 reasoning effort 或可用工具,不再使已缓存上下文失效——这对 Agent 是关键,以前调整工具集就要重算整个前缀;
- 缓存读取享受 90% 折扣(与 5.6 系列一致),写入溢价 25%;
- OpenAI 披露 GitHub 上 billions 级请求的数据:需要新鲜处理的 prompt token 份额下降超过 50%,直接反映在 Copilot 的延迟与成本上。
配合前面说的"多花 2k 输出 token",整个成本模型的正确理解是:OpenAI 把钱从"重复读前缀"上省下来,贴到"多写输出"上去了。长对话、Agent 场景受益最大;单轮短问答场景,感受会弱一些。
五、我的判断,以及保留意见
判断:
- Sol 是"防守反击"型发布:能力不冒进、价格直接砍半,目标是守住中间价位段。考虑到 Anthropic 的 Opus 5.5 比 OpenAI 的发布早 90 分钟,这个时间点本身就是回应;
- 幻觉治理路线值得行业注意。"少回答换少犯错"是比"全部硬答"更诚实的取舍,预计会成为后续模型的普遍选择——但对下游产品意味着要做"拒答兜底"设计;
- GDPval 的退步是选型分水岭。编码/Agent 负载选 Sol 很划算;长文档交付类负载,建议等一等或保留前代。
保留意见:
- OpenAI "内部事实性评测错误减半、接近 Astra 级可靠性"是基于自有评测、以自家前代为参照的口径,跨实验室对比仍需等独立数据;
- AA 的 GDPval / AA-Briefcase 退步结论基于其私有 harness 与人工抽检,样本与方法未完全公开,方向可信、幅度存疑;
- 所有 max effort 数据,默认 effort 下表现会有差异,评测前先确认档位。
一句话总结:这一代 GPT-6 Sol 的故事不是"更聪明",是"同样聪明但诚实了一半、便宜了一半"。对大部分开发者,这比变聪明有用。
资料来源:Artificial Analysis《GPT-6 Sol and Luna push the cost efficiency frontier》(2026-09,独立实测);OpenAI 官方发布公告与 Better Prompt Caching for GPT-6 说明;MacRumors、AI Industry Today、AI Chat Daily 报道(2026-09-22/23)。
本文基于第三方独立评测与官方公告整理,数据以 AA 原文为准;不构成投资建议。
#GPT-6 Sol#Artificial Analysis#幻觉#大模型评测#OpenAI#成本优化