返回知识库

AI 与提示 · 模型与输出

温度Temperature

温度作用在 logits 的 softmax(除以 T):T→0 趋近 argmax、输出可复现,T 高则分布变平、越发散;按任务目标与可验证指标选择。

温度实验室:拖滑块,连采几次看复现

温度作用在 logits 的 softmax 上(logit 除以 T)。把滑块从 0 拖到 1.5,看候选 token 的概率分布从「一根针」铺平成「人人有机会」,再点「采样一次」连采几次——低温下结果稳定复现,高温下每次都不同。

固定 prompt给这款跑鞋写一句 slogan:
0.3
候选下一 token(按 logit 排)T=0.3 · softmax(logit/T)
轻盈90%
极速9%
每一步1%
飞跃0%
自由0%
燃烧0%
采样结果(最新在上)尚未采样

点「采样一次」连采几次,看结果从「每次一样」到「每次不同」。

未采样。原因:当前温度 0.3,分布条把 logit 除以 T 跑 softmax——温度越低,高位 token(轻盈)越接近 100%。对照:把滑块拖到 0,分布塌成一根针。下一步:点「采样一次」连采几次。

知识点总结

面板已经把核心关系演示出来,这里只做命名和收口。

  • 温度 = 采样随机性旋钮:作用在 softmax 上,logit 除以 T;T 越低分布越尖,T 越高分布越平。
  • T→0 趋近 argmax:把滑块拖到 0,分布塌成一根针,采样退化为贪心解码,同一 prompt + 同一模型每次输出一致——可复现,但不是「自动正确」。
  • T=0 不是真零随机:它取最大 logit 的 token,而不是消除随机性的「魔法开关」;贪心解码本身是一种确定性策略。
  • 高温=多样但有代价:低 logit 的 token 也拿到可观概率,输出更发散,可能跑偏或事实失准,需要更强约束和评审。
  • 任务决定温度:事实问答、抽取、结构化 JSON 用低温要稳定;头脑风暴、文案、对话语气用高温要多样。

什么时候用低温 / 高温

从「我要稳定还是要多样」这个信号出发,不是凭感觉调参。

  • 低温(≈0–0.3):代码补全、结构化 JSON、事实抽取、分类——要可解析、可复现、可测试的输出。
  • 中温(≈0.4–0.7):对话助手、文案草稿、有节制地换措辞;多数通用 API 调用的默认区间。
  • 高温(≈0.8–1.5):头脑风暴、创意命名、多样化候选——接受差异,但仍要事实和安全评审。
  • 不适用:不要用温度解决「输出不正确」的问题——低温让结果稳定,但不保证对;正确性要靠 prompt、检索、评测和约束解码。

怎么用

从固定 prompt 走到可判断结论的最短路径。

固定 prompt + 模型选温度连采 N 次评测集判断记录采样设置
  • 固定 prompt、模型、随机种子(若 API 支持)和重复次数,分布律才有可比性。
  • 结构化输出配 schema 或解析检查,代码配测试;用通过率而非「看起来像」判断。
  • 高温输出的事实、安全和敏感内容仍需评审;记录温度以便复现。

正反例:同一个 slogan 任务,温度选错差很多

目标都是给跑鞋起一句 slogan,只改温度。

正例:T=0 + 多采几次

分布集中在高位 token,输出稳定可复现;连采几次几乎一样,便于团队评审和定稿。

反例:T=1.5 求创意

分布铺平,低 logit 的 token 频繁冒头,每次跑偏、难以收敛;起 slogan 看似该用高温,但没有约束时只会增加筛选成本。

快速自测

你要用 LLM 把合同条款抽成结构化字段(金额、日期、乙方),希望同一份输入每次结果一致、能自动校验。温度该怎么设?

继续查证

术语的技术定义和行为以这些一手或权威资料为准。

下一步学

和本知识点经常一起出现的概念。