☰
AI推理三年降价99%,我上个月的API账单却翻倍了
2026/10/8 18:23:21 网站建设 项目流程

上个月月底,我盯着公司的 API 账单愣了半天。单价明明一直在跌,同一家云厂商、同一个模型,每百万 token 的价格比年初便宜了一大截,结果总账单反而比上上个月多了将近一倍。我第一反应是财务算错了,拉了调用量明细一看,错误的是我:调用量涨得比价格跌得快得多。

这不是我一个人遇到的事。研究机构 Epoch AI 今年有个统计,过去三年里,达到同等基准成绩的推理价格大约降了 99%,折算下来一年差不多是 13 倍的速度往下掉。这个降幅比历史上任何一项技术都猛,DNA 测序、锂电池、甚至电力价格的历史曲线,都没这么陡过。可有意思的地方也在这儿:价格崩了,算力反而更抢手了。Tomasz Tunguz 最近分析了云市场的 GPU 租金,半年时间从每小时 4.4 美元涨到了 8.08 美元,直接翻倍。推理单价在跳水,GPU 租金在翻倍,这两条曲线放在一起看,怪得很,但你想明白其中一层,后面的门道就都通了。

把时间往回拨一点。GPT-4 刚发布那会儿,百万 token 收 30 美元,敢用的人不多;到今年年中,同等能力的模型已经能压到 0.5 美元以内。三年降价 99% 不是哪家厂商打价格战打出来的,是模型架构、量化技术、推理引擎一起挤出来的水分。FP8 量化把显存占用砍半,投机解码让每张卡每秒多吐不少 token,连续批处理把原本互相等待的请求打包一起算。每一项单拿出来都不算惊天动地,叠在一起,就是把"智力"的单价打到了地板上。

按以前的常识,东西便宜了,大家省下的钱可以干别的,算力需求总该缓一口气吧?现实正好相反。这就是经济学里那个杰文斯悖论:19 世纪有人发现,蒸汽机效率越高,煤烧得越多——因为效率提升后,原来不值得用蒸汽机干的事,突然都值得干了。今天的大模型一模一样。单价跌破某个心理线之后,原来"用不起"的场景全冒出来了。以前一个客服问答要抠抠搜搜地精简 prompt,现在随手丢给模型整段工单;以前不敢想的"每条数据都过一遍大模型做清洗",现在成了常规操作。我的账单翻倍就是这个原因:模型调用从"偶尔用一次的重活"变成了"塞进每条业务链路的调料",几十个原来人工处理的环节,现在每个都在悄悄烧 token。还有一个不太体面的原因:Agent 应用动不动就是几十次模型调用串成一串,一次任务顶过去五十次调用,单次再便宜也架不住次数翻这么多倍。

这个悖论接下来会怎么走?我的判断是:单价还会继续跌,可能比现在跌得更狠,而总算力需求大概率还是会涨。两件事给这个判断托底。头一件,OpenAI 跟 Broadcom 合作的自研推理芯片已经在路上了,厂商把推理服务成本打下来之后,转头就会接着降价抢市场,价格战不会停。另一件,硬件那边反而更紧张:数据中心在跟电力、土地、融资成本较劲,Oracle 甚至在新墨西哥的数据中心项目上援引了不可抗力条款。供给受限、需求爆炸,租金很难往下走。对写代码的人来说,有几件事现在就值得做。先说最实在的:把"用了多少 token"这个老习惯扔掉,改成按"任务"记账,一个任务串了多少次调用、哪一步烧得最凶,这才对得上你的账单。再说选型:固定格式抽取这类简单活儿,降级到小模型,成本能差出几十倍。数据有隐私要求的,二手 32G 显存的卡已经跌到一千多美元,本地跑量化模型这条路,第一次真正摸得着了。至于那些要长期锁 GPU 算力的大合同,签约之前多想一步——模型效率再涨一年,你锁的产能可能就是别人眼里的闲置资源。

最后留个问题给你:当"智力"的单价无限逼近零,你的应用里还有哪些环节,是纯粹因为"以前贵"才留着没改的?这些环节现在值不值得重写一遍?评论区聊聊,我很好奇你们账单上最意外的那一行是什么。

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询