第 3 天 · Token 与计费:为什么聊得越久越贵
2026/9/16 9:15:09 网站建设 项目流程

第 3 天 · Token 与计费:为什么聊得越久越贵 🚀

💡 今日引入

你有没有想过,为什么同样一个问题,你跟 AI 多聊几轮之后,费用就越来越贵?不是模型坑,而是它收费的最小单位,跟你想的"字数"根本不是一回事。

🔗 接上昨天

上次提到了:你和 AI 的对话,底层就是一个messages数组。今天顺着这根线往下走——这个数组送进模型之前,会被先切成一堆"碎片",模型按碎片数量收费。所以"数组怎么组织",直接决定了你花多少钱。

📚 核心讲解

1. 先把"字"和"token"分开

模型读不懂"字"或"词",它处理文本的最小单位是token(可以想象成乐高颗粒)。你发给它的每一句话,会先被一个叫tokenizer的工具切成 token 序列。

关键是:token 既不等于字,也不等于词。

  • 一个英文常见词通常 1 个 token(比如hello
  • 一个汉字大约 1~2 个 token
  • 代码、标点、emoji 的切法又各不一样

所以同一段中文,在不同模型里切出来的 token 数可能差不少。别再用"我发了多少字"去估费用,那是两码事。

2. 钱分两笔:输入 token 和输出 token

每次调用返回里都有个usage字段,它是和钱包直接挂钩的:

importopenai# 或任意 OpenAI 兼容接口,如 DeepSeekresp=client.chat.completions.create(model="deepseek-v4-flash",messages=[{"role":"user","content":"帮我写段项目总结"}],)print("输入 token:",resp.usage.prompt_tokens)# 你发的 messages 被切成多少块print("输出 token:",resp.usage.completion_tokens)# 模型生成了多少块print("缓存命中:",resp.usage.prompt_cache_hit_tokens)# 命中缓存的前缀块数
  • prompt_tokens:你发的内容(输入)被切成多少块
  • completion_tokens:模型生成的内容(输出)有多少块
  • total_tokens:两者之和

重点来了:输出一般比输入贵。因为输入可以并行处理,而输出必须一个一个串行生成,每生成一个 token 模型都要单独做一次预测计算,GPU 利用率更低。所以"让 AI 少废话"本身就是省钱。

3. 聊得越久越贵,根因是"无状态 + 全量重发"

这点和前两天串起来了:模型本身是无状态的,每一次请求都独立。想让它"记得"之前聊过什么,唯一的办法是把完整历史重新塞进messages数组再发一遍。

历史越长,数组越长,prompt_tokens越大,费用越高。这就是为什么长对话"越聊越贵"——你每次都在为整段聊天史重复买单。

4. Prompt Cache:前缀复用就是白捡的折扣

好消息是,服务商早就注意到这个痛点,搞了个Prompt Cache(提示缓存)

每一次请求里,前面一大段(system提示、固定的工具定义、历史上下文)基本是不变的。服务商第一次算完会把这部分前缀缓存起来,后续请求只要前缀一致,就直接复用,只算新增的那点尾巴。

命中缓存的 token 价格通常低到正常输入的1/10左右,响应也更快。但要注意一个坑:缓存认的是"字节级一致的前缀",不是意思一致。你只要在system提示里塞个时间戳、或者把消息顺序打乱,整段前缀就失效,折扣全没。

所以后面我们做 Agent 时会反复强调一句话:把稳定不变的内容放前面,动态内容放最后,保证前缀一致,缓存命中率才高。

🌐 热点连线

2026 年圈子里有个明显的趋势:大家不再只比"哪个模型每 token 更便宜",而是比"谁的缓存命中率高"。多家分析(Noded、Creedtec、Varidata 等)给出的结论很一致——

  • 三大厂商的缓存命中都能把输入成本砍掉80%~90%
  • 再叠一个Batch(批量)异步调用,直接半价
  • 还有"模型路由":把 80%~90% 的简单问题甩给便宜的小模型,价差能到 25~50 倍

说白了,2026 年真正会省 AI 钱的人,拼的不是选了哪个旗舰模型,而是懂不懂 token 怎么切、前缀怎么放、缓存怎么命中

✅ 今日小结

  • token 是模型收费的最小单位,不等于字也不等于词,中文一个字约 1~2 个 token。
  • 费用分两笔:输入 token 和输出 token,输出因为要串行生成,通常更贵。
  • 长对话变贵的根因是"无状态 + 每次全量重发历史";用 Prompt Cache 复用前缀能省一大笔。

一句话记忆点:上下文越长,账单越长。

💬 写在最后

这是我自学 AI 大模型记的第 3 篇笔记。我会把这些学习心得持续发出来,边学边发博客巩固。如果你也在自学 AI、想搞懂这些底层逻辑,欢迎关注我、看看我的博客,咱们一起把这座山一点点爬下来 💪

#AI学习 #大模型 #跟着学AI #LLM #Token计费 #PromptCache

需要专业的网站建设服务?

联系我们获取免费的网站建设咨询和方案报价,让我们帮助您实现业务目标

立即咨询