一、开篇:确定性与创造性由谁决定
同样是写一段话,大模型有时输出稳定严谨,有时又天马行空。这个差异主要来自Temperature 温度参数与采样策略——它们共同决定了大模型输出的确定性和创造性。
二、基础概念
大模型生成下一个 token 的时候,会算出一个概率分布,代表每个候选词出现的可能性。**采样策略就是根据这个概率分布,选下一个输出词的规则。**而 Temperature 是调节这个概率分布的核心参数。
三、Temperature 温度起什么作用
3.1 温度低(趋近 0)
会放大概率差距,高概率词概率变得更高,低概率词几乎被抹掉,模型倾向选最有把握的词。输出确定性高、重复度高、创造性弱、答案稳定,适合写事实、代码、客观问答。
3.2 温度高(比如 1 以上)
拉平各个词的概率,冷门词也有机会被选中。输出随机性变强、创意强,但更容易胡说、产生幻觉,适合写故事、文案、头脑风暴。
3.3 Temperature = 1
代表使用模型原始概率分布,不加缩放,是理解其他取值的基准。
四、常见采样策略
4.1 Top-K 采样
只保留概率最高的 K 个候选 token,剩下全部直接丢弃,再从中抽样。K 固定,不管场景,候选池大小不变。
4.2 Top-P 核采样
不去固定数量,累积概率达到 P 值就停止,只保留累计概率达到阈值的候选集合。高概率集中时候选词少;概率分散时候选词变多。现在工业界大模型大多默认用 Top-P。
4.3 温度和 Top-P 配合使用
温度控制整体随机程度,Top-P 兜底过滤掉概率极低的离谱候选词。两者经常一起使用,兼顾"随机度"与"不出格"。
五、对比总结与搭配建议
想要严谨、稳定、少幻觉:调低 temperature,搭配较小的 Top-P。
想要创意、多样化答案:调高 temperature,但幻觉风险上升。
六、总结
Temperature 温度和采样策略,用来控制大模型生成时的随机性,平衡输出的确定性和创造性。模型每一步会给出下一个 token 的概率分布。Temperature 用来缩放这个分布:温度低,优先选概率最高的词,输出确定、保守,但多样性差;温度高,冷门词也有机会被选中,创意更强,但幻觉风险会上升。常用采样策略有 Top-K 和 Top-P 核采样。Top-K 固定保留概率最高 K 个词;Top-P 是累积概率达到阈值就截取候选集,会动态调整候选数量,现在用得更多。实际使用中两者经常配合。做客观任务、写代码,温度调低;做创作类任务,可以适当调高温度。