返回知识库

AI 与提示 · 多模态与媒体

语音合成TTS

TTS 把文字合成语音。订单号、日期要在出声前选对读法;敏感内容先拦住。用户要能看见原文、暂停和关闭。

先认出这条播放,再看单号是怎么被念出来的

下面就是发货通知的播放条。默认按位读 2048;按数量会念成两千零四十八;身份证号在出声前被拦住。

正在播 · 0:06按位朗读

订单 二 零 四 八,已发货。

订单号按位读。听的人能对回屏幕上的 2048。

原因:数字按位读,和屏幕一致。下一步:改成按数量读,看单号会不会对不上。

知识点:出声前先决定怎么读

播放条上的读法和拦截已经演过,这里只给命名。

  • TTS 把文字合成可播放语音:先正规化文本,再选读音、韵律和音色。
  • 订单号、日期、多音字必须在合成前消歧,否则听的人会对错。
  • 要能暂停、看到正在读的字、关掉声音。未授权音色不能用。
  • 敏感字段先拦再合成。它不是 ASR:方向是字 → 声。

什么时候用、怎么用

用户需要听,而不是盯着屏幕读的时候。

  • 信号:到货通知、无障碍朗读、车载播报。
  • 适用:先显示原文,数字按任务选读法,提供暂停和关闭。
  • 不适用:把别人的声音克隆去冒充;也不要把身份证号念出来。
  • 最短路径:看原文 → 选定读法 → 播放 → 听错就改正规化规则。

正反例:同一条「订单 2048 已发货」

屏幕上都是 2048。

正例按位读 二 零 四 八

用户能对回订单号,客服电话也对得上。

反例念成「两千零四十八」

听的人会去找 20048。数字读法没在合成前锁定。

快速自测

要把身份证号读给用户听,方便核对。TTS 最该怎么做?

继续查证

术语的技术定义和行为以这些一手或权威资料为准。

下一步学

和本知识点经常一起出现的概念。