返回知识库

AI 与提示 · 模型与输出

推理Inference

推理是用训练好、只读的参数跑一次请求:先一口气算完输入,再一个字一个字写出回答。首字快慢看输入长度,稳不稳看温度。

先认出这条正在出字的回复,再看首字为什么慢

下面就是一次推理跑出来的客服摘要。默认短输入已经出字;整段工单会让气泡空着等;打开采样,同一工单会换措辞。

工单 #421TTFT 290ms · temp=0

退款申请已提交。订单审核中,约 2 工作日。

已出首字同输入再跑一次,字一个都不会变。

原因:短输入 prefill 很快,temp=0 每步挑最高,所以可复现。下一步:换成整段工单,看首字会不会卡住。

知识点:吃完整段,再一个个吐

收据和气泡已经演过,这里只给命名。

  • 推理只读取训练好的参数,不改模型;所以 temp=0 时同输入永远同输出。
  • prefill 把整段输入一次算完,决定你等多久看到第一个字(TTFT)。
  • decode 再一个 token 一个 token 往外写,决定后面流得快不快。
  • temp=0 可复现;temp>0 采样,每次可能不同。

什么时候盯推理、怎么盯

首字不出、出字卡、结果飘,多半不是「模型不够聪明」。

  • 信号:半天不出第一个字,或同工单每次摘要都不一样。
  • 适用:砍输入、换更小档、锁 temp=0 做回归。
  • 不适用:把推理当成训练;这一步不更新权重。
  • 最短路径:看 TTFT → 判断是输入太长还是采样开了 → 改一处再跑同一工单。

正反例:同一张工单,只换温度

都要写摘要,差别只在能不能复现。

正例temp=0 跑摘要

同一个工单每次同一段话,便于回归。质量不够就改提示或换档,不靠碰运气。

反例temp=0.8 还要求结果稳定

你以为模型不稳定,其实是把确定性开关关了。

快速自测

用户抱怨「同一个工单,每次摘要都不一样,没法回归」。最该先检查哪一项?

继续查证

术语的技术定义和行为以这些一手或权威资料为准。

下一步学

和本知识点经常一起出现的概念。