先记住这个答案
采样温度 T 在 softmax 前将 logits 除以 T。T 越小,概率差被放大,高概率 token 更占优,输出更确定;T 越大,分布趋于均匀,低概率 token 也有机会被选中,文本更多样但可能混乱。典型做法:事实问答用 T=0 或低值,创意写作用 T=0.7–1.0,超过 1.5 通常不稳定。
- 温度缩放 logits 后改变概率分布
- 低温增加确定性,高温增加多样性
- 值超过 1.5 后质量明显下降
温度作用的数学机制
模型最后输出每个候选 token 的 logits z_i。温度 T 首先将 logits 缩放为 z_i/T,然后送入 softmax 计算概率 p_i = exp(z_i/T) / Σ_j exp(z_j/T)。当 T=1 时分布不变;T 越小,z_i/T 的差异被放大,例如两个 logits 相差 2,T=0.5 时差变为 4,softmax 后高 logits 的 token 概率更高,分布更尖锐。
T 趋近 0 时,概率最大的 token 概率趋向 1,等效于贪心解码(argmax)。T 很大时,所有 z_i/T 都接近 0,exp 值接近相等,概率趋近均匀随机。因此 T 并不改变 token 的相对排序,只改变概率分配的集中程度,但采样时低概率 token 的绝对概率仍可能非零,这就是随机性的来源。
客服分类与创意文案的取值对比
假设构建一个电商客服意图识别模块,输入用户消息后模型需从固定的 20 个意图标签中选一个。若 T 设为 1.0,相似意图(如“退款”与“退货”)的概率会接近,随机采样可能导致标签抖动。实际处理时将 T 设为 0.2,logits 差被放大,最高分的标签概率超过 0.95,多次调用结果稳定,没有额外后处理。
相反,为营销邮件生成 10 条不同主题标题时,同样模型用 T=1.2 采样,每次会抽到不同但合理的词语组合,多样性明显。若误用 T=0.1,几乎每次输出都相同,无法产生创意变体。因此温度应依据任务对“确定性”与“多样性”的需求来调节,不是越高或越低永远更好。
温度失效与调整代价
温度对概率分布的影响依赖于有效 logits 的区分度。当模型对输入不确定,各候选 logits 本身就十分接近(例如长难任务或模型知识不足),调低 T 无法真正消除随机性,只是把相近的概率硬生生压缩后仍然可能选中次优项,此时输出质量不会因 T=0 而变高。
反过来,T 过高(如 >2)会使分布过于均匀,甚至每个 token 都有相似概率,采样结果近乎随机词组合,退化严重。实际中若发现低 T 仍然不稳定,应检查是否上下文信息不足,而非一味微调温度。调参只是工程手段,不能替代模型能力或必要的结构约束。
容易答错的地方
- 认为温度越高创造力越强
- 过高温度使分布接近均匀,低概率 token 频繁被选,语句不连贯、事实错乱,创造力应以不破坏语法和逻辑为前提,通常 0.8–1.2 范围较安全。
- 把 T=0 当作不会出错
- T=0 只是固定选最高概率 token,若最高概率本身对应不正确答案,仍会出错。它只消除采样随机性,不消除模型错误。
面试官还会怎么问?
temperature 与 top-p 同时设置如何协调?
两者独立但相互作用。通常先按温度缩放 logits,再做 top-p 截断。低 T 配合较高 p 不影响分布;高 T 时 p 值应调低以过滤掉尾部的不可靠 token。实际需按任务组合测试。
temperature 能直接控制生成文本的重复程度吗?
不能直接控制。低 T 可能增加贪婪重复,但重复根因常来自训练数据或采样策略。调节 T 只能间接影响,缓解重复更有效的是重复惩罚或适当的 top-p。
用 API 时 temperature 参数设置为 0 和关闭采样是否等价?
许多 API 将 T=0 定义为确定性解码,等价于 argmax。但部分实现中 T=0 可能有除零保护而退化为贪心,本质上没有随机性,与关闭采样效果相同。
参考资料
示例用于理解所注明的运行环境与边界;延伸学习可结合原文中的更多案例。