前端进阶之旅前端进阶之旅
  • 基础篇HTML/CSS/JS 打底
  • 进阶篇原理与工程化
  • 高频篇面试最常问的那批
  • 精选篇按模块收敛的总结
  • 手写篇常考代码手写实现
  • 面经篇真实面试问题复盘
  • AI 篇NEWAI 时代的前端考点
  • 历年面经NEW按年份追踪真实考点
  • 每日一题每天一道,攒手感
  • 专项自测100 题快速查漏
  • 小程序题库小程序专项刷题
  • 算法题库NEW在线编码即时判题
  • 知识卡片NEW碎片时间过考点
  • 面试题大全常见问题解析
  • AI 答疑NEW随时提问,即时解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • AI 定制路线NEW按你的简历现排
  • AI 知识地图NEW串起全站知识点
  • 原理篇React / Vue 源码拆解
  • HTTP从报文一路讲到 HTTPS
  • 浏览器渲染、事件循环、进程
  • 计算机基础Linux、网络、操作系统
  • 设计模式23 种模式怎么用
  • Node学习指南从环境搭建到服务端
  • NPM工作流script、依赖与发布
  • Docker容器化部署上手
  • Canvas图形与动画实战
  • 前端系统进阶学习大型项目工程化
  • 前端综合文章长期沉淀的实践文
  • 思维导图知识点全景图
  • 学习路线按图索骥不跑偏
  • AI 热点NEWAI 每日动态
  • 公众号动态公众号历史文章
  • 博客动态站长的技术博客
  • 开发者导航常用工具与文档站
  • 基础篇HTML/CSS/JS 打底
  • 进阶篇原理与工程化
  • 高频篇面试最常问的那批
  • 精选篇按模块收敛的总结
  • 手写篇常考代码手写实现
  • 面经篇真实面试问题复盘
  • AI 篇NEWAI 时代的前端考点
  • 历年面经NEW按年份追踪真实考点
  • 每日一题每天一道,攒手感
  • 专项自测100 题快速查漏
  • 小程序题库小程序专项刷题
  • 算法题库NEW在线编码即时判题
  • 知识卡片NEW碎片时间过考点
  • 面试题大全常见问题解析
  • AI 答疑NEW随时提问,即时解析
  • AI 模拟面试NEW模拟真实面试 + 报告
  • AI 定制路线NEW按你的简历现排
  • AI 知识地图NEW串起全站知识点
  • 原理篇React / Vue 源码拆解
  • HTTP从报文一路讲到 HTTPS
  • 浏览器渲染、事件循环、进程
  • 计算机基础Linux、网络、操作系统
  • 设计模式23 种模式怎么用
  • Node学习指南从环境搭建到服务端
  • NPM工作流script、依赖与发布
  • Docker容器化部署上手
  • Canvas图形与动画实战
  • 前端系统进阶学习大型项目工程化
  • 前端综合文章长期沉淀的实践文
  • 思维导图知识点全景图
  • 学习路线按图索骥不跑偏
  • AI 热点NEWAI 每日动态
  • 公众号动态公众号历史文章
  • 博客动态站长的技术博客
  • 开发者导航常用工具与文档站
首页程序员面试题库LLM temperature 采样 参数
AIAI 开发大模型基础

大模型采样参数 temperature 如何影响生成文本的分布?

温度通过缩放 logits 再经 softmax 重塑概率分布:低温锐化、高温平坦化,直接影响生成文本的确定性与多样性。

前端进阶之旅 · 一题精讲更新于 2026.09.05
AI 开发#大模型基础
先看核心答案
理解线索

温度重塑 softmax 概率

  1. logits 处理先除以 T 再进 softmax
  2. T<1 锐化概率集中于高 logit token
  3. T>1 平坦化各 token 概率趋于均匀

T=0 并非概率全零,而是取 argmax 的确定性采样。

核心回答

先记住这个答案

采样温度 T 在 softmax 前将 logits 除以 T。T 越小,概率差被放大,高概率 token 更占优,输出更确定;T 越大,分布趋于均匀,低概率 token 也有机会被选中,文本更多样但可能混乱。典型做法:事实问答用 T=0 或低值,创意写作用 T=0.7–1.0,超过 1.5 通常不稳定。

  • 温度缩放 logits 后改变概率分布
  • 低温增加确定性,高温增加多样性
  • 值超过 1.5 后质量明显下降

温度作用的数学机制

模型最后输出每个候选 token 的 logits z_i。温度 T 首先将 logits 缩放为 z_i/T,然后送入 softmax 计算概率 p_i = exp(z_i/T) / Σ_j exp(z_j/T)。当 T=1 时分布不变;T 越小,z_i/T 的差异被放大,例如两个 logits 相差 2,T=0.5 时差变为 4,softmax 后高 logits 的 token 概率更高,分布更尖锐。

T 趋近 0 时,概率最大的 token 概率趋向 1,等效于贪心解码(argmax)。T 很大时,所有 z_i/T 都接近 0,exp 值接近相等,概率趋近均匀随机。因此 T 并不改变 token 的相对排序,只改变概率分配的集中程度,但采样时低概率 token 的绝对概率仍可能非零,这就是随机性的来源。

客服分类与创意文案的取值对比

假设构建一个电商客服意图识别模块,输入用户消息后模型需从固定的 20 个意图标签中选一个。若 T 设为 1.0,相似意图(如“退款”与“退货”)的概率会接近,随机采样可能导致标签抖动。实际处理时将 T 设为 0.2,logits 差被放大,最高分的标签概率超过 0.95,多次调用结果稳定,没有额外后处理。

相反,为营销邮件生成 10 条不同主题标题时,同样模型用 T=1.2 采样,每次会抽到不同但合理的词语组合,多样性明显。若误用 T=0.1,几乎每次输出都相同,无法产生创意变体。因此温度应依据任务对“确定性”与“多样性”的需求来调节,不是越高或越低永远更好。

温度失效与调整代价

温度对概率分布的影响依赖于有效 logits 的区分度。当模型对输入不确定,各候选 logits 本身就十分接近(例如长难任务或模型知识不足),调低 T 无法真正消除随机性,只是把相近的概率硬生生压缩后仍然可能选中次优项,此时输出质量不会因 T=0 而变高。

反过来,T 过高(如 >2)会使分布过于均匀,甚至每个 token 都有相似概率,采样结果近乎随机词组合,退化严重。实际中若发现低 T 仍然不稳定,应检查是否上下文信息不足,而非一味微调温度。调参只是工程手段,不能替代模型能力或必要的结构约束。

回答前,多想一步

容易答错的地方

认为温度越高创造力越强
过高温度使分布接近均匀,低概率 token 频繁被选,语句不连贯、事实错乱,创造力应以不破坏语法和逻辑为前提,通常 0.8–1.2 范围较安全。
把 T=0 当作不会出错
T=0 只是固定选最高概率 token,若最高概率本身对应不正确答案,仍会出错。它只消除采样随机性,不消除模型错误。
试着用自己的话回答

面试官还会怎么问?

temperature 与 top-p 同时设置如何协调?

两者独立但相互作用。通常先按温度缩放 logits,再做 top-p 截断。低 T 配合较高 p 不影响分布;高 T 时 p 值应调低以过滤掉尾部的不可靠 token。实际需按任务组合测试。

temperature 能直接控制生成文本的重复程度吗?

不能直接控制。低 T 可能增加贪婪重复,但重复根因常来自训练数据或采样策略。调节 T 只能间接影响,缓解重复更有效的是重复惩罚或适当的 top-p。

用 API 时 temperature 参数设置为 0 和关闭采样是否等价?

许多 API 将 T=0 定义为确定性解码,等价于 argmax。但部分实现中 T=0 可能有除零保护而退化为贪心,本质上没有随机性,与关闭采样效果相同。

从一道题,走向一组知识

把知识连起来

大模型基础

大模型输出的 logits 是什么,如何从中解读模型对每个 token 的置信程度?

同属「大模型基础」专题,接着看 LLM logits logprobs 置信度 在具体场景中的处理方式。

大模型基础

大语言模型中的 token 化(如 BPE 分词)是如何把文本转成模型输入的?

同属「大模型基础」专题,接着看 LLM tokenization BPE 分词 在具体场景中的处理方式。

参考资料

  • Increase output consistency - Claude Platform Docs

示例用于理解所注明的运行环境与边界;延伸学习可结合原文中的更多案例。

本题目录
  1. 先记住这个答案
  2. 温度作用的数学机制
  3. 客服分类与创意文案的取值对比
  4. 温度失效与调整代价
  5. 容易答错的地方
  6. 面试官还会怎么问
  7. 把知识连起来
读懂,再试着讲出来

先看核心答案,再读代码。最后展开追问,检查自己有没有遗漏边界。

试着回答追问
浏览全部面试题理解原理,也关注真实的使用场景。回到顶部 ↑