返回知识库

AI 与提示 · 多模态与媒体

语音识别ASR

ASR 把说话转成带时间戳的文字。噪音和同音会听错数字;空音频要拒转,低置信词必须能点回原声。

先认出这条语音和转写,再看听错数字会怎样

下面就是客服录音。默认听清订单 2048;底噪会把 8 听成 0;没有人声就拒转,不编一句客套。

0:04 · 客服听清了

▁▃▅▇▅▃▁▃▅

「订单 2048 帮我退一下。」安静环境。订单号和时间戳都能对回原音频。

原因:人声清楚,订单号能对回原音频。下一步:加底噪,看 2048 会不会变成 2040。

知识点:转写不是事实本身

语音条上的订单号和拒转已经演过,这里只给命名。

  • ASR 把音频变成带时间戳的文字,必要时标出说话人。
  • 噪音、口音、同音数字会听错;低置信词要能点回原音频。
  • 空音频或无人声应拒转,不能编一句「您好请问有什么可以帮您」。
  • 它不是 TTS:ASR 是听写成字;TTS 是把字念出来。

什么时候用、怎么用

证据在录音里,需要变成可搜索、可核对的文字时。

  • 信号:客服电话、会议、语音留言。
  • 适用:转写 + 时间戳;订单号、人名低置信就标出来给人改。
  • 不适用:已经是文字的聊天记录——不必再转一遍。
  • 最短路径:放录音 → 看转写 → 对不上就点回原音频修订。

正反例:同一句「订单 2048 帮我退」

都要退这一单。

正例转写成 2048,能点回 0:04

退款打到正确订单,数字可回放核对。

反例嘈杂里写成 2040 并直接退

退错单。同音数字没有复核出口。

快速自测

转写里订单号 2048 和 2040 两个候选几乎一样高。下一步?

继续查证

术语的技术定义和行为以这些一手或权威资料为准。

下一步学

和本知识点经常一起出现的概念。