☰
一夜两轮价格战,token 价格腰斩:Agent 时代工程师的省钱实战
2026/9/27 9:54:56 网站建设 项目流程

一夜两轮价格战,token 价格腰斩:Agent 时代工程师的省钱实战

9 月底这波价格战打得比双 11 还狠。但真正的重点不是"又便宜了",而是:当你的 Agent 一天烧掉过去一个月的 token,定价降一半可能还是亏的。这篇文章聊聊我对这轮价格战的判断,以及我在自己项目里验证过的一套降本打法。

一、先回顾:这场价格战是怎么打起来的

9 月下旬,Anthropic 发布 Opus 5.5 家族首款模型,每百万 token 输入 4 美元、输出 20 美元,比上一代直降约 40%,输出速度还提升了 30%。

几个小时后,OpenAI 当晚反击:上线 GPT-6 Sol(2/10 美元)和超低价 Luna(0.10/0.50 美元),价格直接腰斩再腰斩。Luna 的输入价格,折合人民币大概 7 毛钱一百万 token——一杯奶茶钱够一个中型 Agent 项目跑好几天。

国内阵营也没闲着。SuperCLUE 9 月榜上,阿里 Qwen3.8-Max 以 72.62 领跑,DeepSeek-V4.1-Flash 以 71.81 紧随其后,其中数学推理 84.21、幻觉控制 87.16 都是国内单项第一。开源阵营这边,月之暗面 Kimi K3 和智谱 GLM-5.3 已经把国际前排的差距咬进了 3 分以内。

一句话总结格局:闭源拼上限,开源拼性价比,中外前排差距缩到 3 分以内。

二、为什么偏偏是现在打价格战?

价格战不是厂商发善心,是需求侧的结构变化逼出来的。三个信号值得注意:

2. 开源权重模型吃掉了半壁江山。Vercel 的数据显示,开源权重模型的 token 份额从 2025 年 12 月的 7% 涨到 2026 年 8 月的 56%。当一半的流量都能用便宜的开源模型承接,闭源厂商只剩两条路:拼上限,或者拼价格。

3. 商业模式跑通了,才有本钱打。DeepSeek 的年化收入运行率已经突破 10 亿美元,几个月翻了一倍。低价不再是赔本赚吆喝,而是能自我造血的定价策略。这轮价格战打的是"规模换生存",不是"烧钱换市场"。

三、价格降了,为什么你的账单可能还是涨的?

这是我最近感受最深的一点。价格战看起来是利好,但 Agent 工作负载有个阴险的特性:消耗增速远超降价速度。

举个例子:你把一个原本用旗舰模型跑的代码审查任务交给 Agent,任务复杂度上升后,单次任务的 token 消耗从 5 万涨到 30 万,涨了 6 倍;价格就算腰斩,账单还是原来的 3 倍。

更麻烦的是 Agent 的隐性成本:

  • 重复前缀:每轮循环都把系统提示、工具定义、历史上下文重新发一遍
  • 失败重试:工具调用失败后整段上下文重算,成本直接翻倍
  • 过度思考:简单任务也被"深度思考"模式跑一遍,推理 token 白烧

好消息是,厂商也在补这些坑。OpenAI 同期为 GPT-6 升级了提示缓存能力,重复前缀不再重复计算,长上下文场景的响应成本显著下降。但等厂商优化不如自己动手,下面是我实战过的四板斧。

四、实战:我的一套 Agent 降本打法

我自己的场景是重度使用 AI Coding 工具链(CLI + IDE 插件),走自建的 API 网关统一接入多个模型。一个月下来,账单降了 60% 以上。方法不复杂,关键是形成习惯。

1. 模型路由:让 flash 干杂活,旗舰只啃硬骨头

这是收益最大的一条。我的原则是:任务分级,模型分级。

  • 代码生成、复杂推理、架构设计 → 旗舰模型(deepseek-v4-pro 这一级)
  • 补全、改写、摘要、格式转换、批量分类 → flash 级小模型
  • 更简单的规则化任务(正则能搞定的)→ 别用 LLM,写死代码

一个容易被忽略的细节:很多 Agent 框架的"总结上一步"这种内部步骤,其实用小模型就够,但默认配置往往全程旗舰。仅这一项调整,某些流水线的成本就能砍一半以上。

2. 提示缓存:把重复上下文变成"半价会员"

Agent 循环里 80% 的输入是重复的——系统提示词、工具 schema、项目规范文档。把这些内容固定放在 prompt 前缀的相同位置,命中缓存后计费和延迟都会大幅下降。

实操要点:动态内容永远放尾部,稳定内容永远放头部。我见过有人把时间戳放在系统提示第一行,直接把缓存命中率打为零,这种 bug 不报错、不告警,只在账单上默默流血。

3. 上下文瘦身:历史不是越多越好

长上下文不是免学费的自助餐。我的做法:

  • 工具返回结果先截断/摘要在进入下一轮循环,只保留关键字段
  • 超过一定轮次后,把早期对话压缩成摘要,而不是全量携带
  • 文件读取按需切片,别为了"让模型看全"把整个仓库塞进去

4. 监控先行:先有账单颗粒度,再谈优化

所有降本的前提是知道钱花在哪了。建议在网关层记录每次调用的:模型、任务类型、输入/输出/推理 token 三项分开统计。跑一周你就会发现,通常 20% 的任务类型贡献了 80% 的成本——然后精准打击那一类任务就够了。

五、写在最后:价格战的终局是什么?

我的判断是:基准模型的 token 价格会持续趋近于电费,真正值钱的两头会越来越贵——一头是前沿能力(顶级推理、超长程 Agent 任务),一头是工程化能力(把便宜 token 组织成可靠业务的那套系统)。

对工程师来说,这意味着两件事:

  1. 别执着于"哪个模型最便宜",定价会一直变,路由能力才是你的
  1. 降本优化的红利期就在当下——等大家都学会了,成本优势就不再是优势

这轮价格战最大的赢家不是哪家厂商,而是正在把工作负载 Agent 化的我们。前提是,你得先算清楚自己的 token 都烧在哪了。


以上价格数据截至 2026 年 9 月 26 日公开报道,具体以各厂商官网为准。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询