它是什么
温度参数是在文本生成的采样阶段调节下一 Token 概率分布和选择随机性的参数。它不会修改模型参数、训练数据或已有知识。较低温度通常让候选概率更集中,输出更可预测;较高温度通常让更多候选获得被选中的机会,输出更具变化。[S1][S2]
为什么需要它
同一个模型面对同一个提示时,产品可能需要稳定的结构化回答,也可能需要多个措辞候选。温度提供了一种控制采样变化程度的手段,让团队能在可预测性和多样性之间试验。但它只改变选择过程,不能判断哪种输出更符合事实、品牌或安全要求。
它如何工作
模型先为下一 Token 计算分数,生成器再用温度调节这些分数对应的概率后进行采样。温度降低时,高概率候选通常更占优势;温度升高时,分布通常更平缓。[S1][S2] 实际 API 还可能同时应用 top-p、top-k 或其他解码规则,因此有效范围、默认值和 0 的行为必须以具体服务文档为准。
必须澄清的误会
温度参数 ≠ 采样。 采样是「如何从概率分布里挑下一个词」的整体做法(含 Top-K、核采样);温度是其中调节分布陡缓的一个系数。
温度参数 ≠ 核采样。 温度把所有候选的概率整体压平或拉陡;核采样按累积概率截断候选集合,两者常一起用但作用机制不同。
真实例子
内容团队可以用同一提示生成活动标题:较低温度用于需要稳定格式的正式标题,较高温度用于收集不同措辞候选。团队随后仍要按事实准确、品牌语气和禁用表达筛选结果。若提示缺少活动日期,提高温度只会改变措辞,不会补回可靠日期。
什么时候适合与不适合
适合生成器启用采样,并且任务允许比较多种合理表达的场景。对严格抽取、代码化字段或必须复现的评估,应优先降低随机性并固定完整配置。解码研究表明,即使模型相同,不同选择策略也会显著改变文本质量;因此温度不是“创造力旋钮”,更不是事实性或安全性的保证。[S2][S3]
亲自试一下
目标是用数据而不是印象选择温度。在保持模型、提示、top-p 和最大长度不变时,选三个温度档位,各生成十次;记录格式通过率、事实错误数、重复度和人工偏好。只有某个档位在目标指标上更合适,才能把它写进产品配置。
接下来学什么
先读模型推理理解生成发生在哪个阶段,再比较采样、核采样和解码策略;最后用AI 评估验证配置变化是否真的改善目标结果。
来源与修订
温度对下一 Token 概率的调节参考 Hugging Face Transformers 文档 [S1];低高温度、采样条件及实现差异参考 Google Vertex AI 文档 [S2];不同解码策略对文本质量的影响参考神经文本退化研究 [S3]。本文不为所有 API 规定统一范围或零值语义。
Learning questions
这个概念出现在哪些题里
下面的题目直接引用了本词条,适合先做判断,再回到正文核对边界。
Case practice
这个概念出现在哪些案例里
案例中的这些关卡会把概念放进业务约束、证据与取舍里练一遍。
Learning navigation
学习导航
沿认知链路:你现在在第 1 站,下一站是「沟通 · 怎么把需求说清楚」:先沿主路径补上这一层。
Relation topology
拓扑图谱网络 · 一度关联场
可拖拽节点、滚轮缩放、点击节点探索温度参数的一层关系
2 个节点 · 1 条直接关系
交互图谱之外,本页下方保留完整文字关系与词条链接。
Source register
核验来源
- Transformers Text GenerationHugging Face · 访问于 2026-07-30
- Content Generation ParametersGoogle Cloud · 访问于 2026-07-30
- The Curious Case of Neural Text DegenerationarXiv · 访问于 2026-07-30
发布 2026-07-30 · 更新 2026-07-30 · 核验 2026-07-30