分布集中在高位 token,输出稳定可复现;连采几次几乎一样,便于团队评审和定稿。
AI 与提示 · 模型与输出
温度Temperature
温度作用在 logits 的 softmax(除以 T):T→0 趋近 argmax、输出可复现,T 高则分布变平、越发散;按任务目标与可验证指标选择。
温度实验室:拖滑块,连采几次看复现
温度作用在 logits 的 softmax 上(logit 除以 T)。把滑块从 0 拖到 1.5,看候选 token 的概率分布从「一根针」铺平成「人人有机会」,再点「采样一次」连采几次——低温下结果稳定复现,高温下每次都不同。
固定 prompt
给这款跑鞋写一句 slogan:▌候选下一 token(按 logit 排)T=0.3 · softmax(logit/T)
轻盈90%
极速9%
每一步1%
飞跃0%
自由0%
燃烧0%
采样结果(最新在上)尚未采样
点「采样一次」连采几次,看结果从「每次一样」到「每次不同」。
未采样。原因:当前温度 0.3,分布条把 logit 除以 T 跑 softmax——温度越低,高位 token(轻盈)越接近 100%。对照:把滑块拖到 0,分布塌成一根针。下一步:点「采样一次」连采几次。
知识点总结
面板已经把核心关系演示出来,这里只做命名和收口。
- 温度 = 采样随机性旋钮:作用在 softmax 上,logit 除以 T;T 越低分布越尖,T 越高分布越平。
- T→0 趋近 argmax:把滑块拖到 0,分布塌成一根针,采样退化为贪心解码,同一 prompt + 同一模型每次输出一致——可复现,但不是「自动正确」。
- T=0 不是真零随机:它取最大 logit 的 token,而不是消除随机性的「魔法开关」;贪心解码本身是一种确定性策略。
- 高温=多样但有代价:低 logit 的 token 也拿到可观概率,输出更发散,可能跑偏或事实失准,需要更强约束和评审。
- 任务决定温度:事实问答、抽取、结构化 JSON 用低温要稳定;头脑风暴、文案、对话语气用高温要多样。
什么时候用低温 / 高温
从「我要稳定还是要多样」这个信号出发,不是凭感觉调参。
- 低温(≈0–0.3):代码补全、结构化 JSON、事实抽取、分类——要可解析、可复现、可测试的输出。
- 中温(≈0.4–0.7):对话助手、文案草稿、有节制地换措辞;多数通用 API 调用的默认区间。
- 高温(≈0.8–1.5):头脑风暴、创意命名、多样化候选——接受差异,但仍要事实和安全评审。
- 不适用:不要用温度解决「输出不正确」的问题——低温让结果稳定,但不保证对;正确性要靠 prompt、检索、评测和约束解码。
怎么用
从固定 prompt 走到可判断结论的最短路径。
固定 prompt + 模型选温度连采 N 次评测集判断记录采样设置
- 固定 prompt、模型、随机种子(若 API 支持)和重复次数,分布律才有可比性。
- 结构化输出配 schema 或解析检查,代码配测试;用通过率而非「看起来像」判断。
- 高温输出的事实、安全和敏感内容仍需评审;记录温度以便复现。
正反例:同一个 slogan 任务,温度选错差很多
目标都是给跑鞋起一句 slogan,只改温度。
分布铺平,低 logit 的 token 频繁冒头,每次跑偏、难以收敛;起 slogan 看似该用高温,但没有约束时只会增加筛选成本。
快速自测
你要用 LLM 把合同条款抽成结构化字段(金额、日期、乙方),希望同一份输入每次结果一致、能自动校验。温度该怎么设?
继续查证
术语的技术定义和行为以这些一手或权威资料为准。
下一步学
和本知识点经常一起出现的概念。