第 3 天 · Token 与计费:为什么聊得越久越贵 🚀
💡 今日引入
你有没有想过,为什么同样一个问题,你跟 AI 多聊几轮之后,费用就越来越贵?不是模型坑,而是它收费的最小单位,跟你想的"字数"根本不是一回事。
🔗 接上昨天
上次提到了:你和 AI 的对话,底层就是一个messages数组。今天顺着这根线往下走——这个数组送进模型之前,会被先切成一堆"碎片",模型按碎片数量收费。所以"数组怎么组织",直接决定了你花多少钱。
📚 核心讲解
1. 先把"字"和"token"分开
模型读不懂"字"或"词",它处理文本的最小单位是token(可以想象成乐高颗粒)。你发给它的每一句话,会先被一个叫tokenizer的工具切成 token 序列。
关键是:token 既不等于字,也不等于词。
- 一个英文常见词通常 1 个 token(比如
hello) - 一个汉字大约 1~2 个 token
- 代码、标点、emoji 的切法又各不一样
所以同一段中文,在不同模型里切出来的 token 数可能差不少。别再用"我发了多少字"去估费用,那是两码事。
2. 钱分两笔:输入 token 和输出 token
每次调用返回里都有个usage字段,它是和钱包直接挂钩的:
importopenai# 或任意 OpenAI 兼容接口,如 DeepSeekresp=client.chat.completions.create(model="deepseek-v4-flash",messages=[{"role":"user","content":"帮我写段项目总结"}],)print("输入 token:",resp.usage.prompt_tokens)# 你发的 messages 被切成多少块print("输出 token:",resp.usage.completion_tokens)# 模型生成了多少块print("缓存命中:",resp.usage.prompt_cache_hit_tokens)# 命中缓存的前缀块数prompt_tokens:你发的内容(输入)被切成多少块completion_tokens:模型生成的内容(输出)有多少块total_tokens:两者之和
重点来了:输出一般比输入贵。因为输入可以并行处理,而输出必须一个一个串行生成,每生成一个 token 模型都要单独做一次预测计算,GPU 利用率更低。所以"让 AI 少废话"本身就是省钱。
3. 聊得越久越贵,根因是"无状态 + 全量重发"
这点和前两天串起来了:模型本身是无状态的,每一次请求都独立。想让它"记得"之前聊过什么,唯一的办法是把完整历史重新塞进messages数组再发一遍。
历史越长,数组越长,prompt_tokens越大,费用越高。这就是为什么长对话"越聊越贵"——你每次都在为整段聊天史重复买单。
4. Prompt Cache:前缀复用就是白捡的折扣
好消息是,服务商早就注意到这个痛点,搞了个Prompt Cache(提示缓存):
每一次请求里,前面一大段(system提示、固定的工具定义、历史上下文)基本是不变的。服务商第一次算完会把这部分前缀缓存起来,后续请求只要前缀一致,就直接复用,只算新增的那点尾巴。
命中缓存的 token 价格通常低到正常输入的1/10左右,响应也更快。但要注意一个坑:缓存认的是"字节级一致的前缀",不是意思一致。你只要在system提示里塞个时间戳、或者把消息顺序打乱,整段前缀就失效,折扣全没。
所以后面我们做 Agent 时会反复强调一句话:把稳定不变的内容放前面,动态内容放最后,保证前缀一致,缓存命中率才高。
🌐 热点连线
2026 年圈子里有个明显的趋势:大家不再只比"哪个模型每 token 更便宜",而是比"谁的缓存命中率高"。多家分析(Noded、Creedtec、Varidata 等)给出的结论很一致——
- 三大厂商的缓存命中都能把输入成本砍掉80%~90%
- 再叠一个Batch(批量)异步调用,直接半价
- 还有"模型路由":把 80%~90% 的简单问题甩给便宜的小模型,价差能到 25~50 倍
说白了,2026 年真正会省 AI 钱的人,拼的不是选了哪个旗舰模型,而是懂不懂 token 怎么切、前缀怎么放、缓存怎么命中。
✅ 今日小结
- token 是模型收费的最小单位,不等于字也不等于词,中文一个字约 1~2 个 token。
- 费用分两笔:输入 token 和输出 token,输出因为要串行生成,通常更贵。
- 长对话变贵的根因是"无状态 + 每次全量重发历史";用 Prompt Cache 复用前缀能省一大笔。
一句话记忆点:上下文越长,账单越长。
💬 写在最后
这是我自学 AI 大模型记的第 3 篇笔记。我会把这些学习心得持续发出来,边学边发博客巩固。如果你也在自学 AI、想搞懂这些底层逻辑,欢迎关注我、看看我的博客,咱们一起把这座山一点点爬下来 💪
#AI学习 #大模型 #跟着学AI #LLM #Token计费 #PromptCache