语音合成(TTS)
别称:TTS · 文本转语音 · 语音播报
语音合成(Text-to-Speech,TTS)是把文本转换成语音的技术。在直播实时翻译里,它负责把译文朗读出来,其耗时大致与译文长度成正比,是端到端延迟的主要来源之一。
在实时翻译里的位置
TTS 是链路的第四段,紧接机器翻译之后。它的输出直接送进虚拟声卡,再由 OBS 推给观众。
它的特殊之处在于:TTS 的耗时不只是「生成」的时间,还包括「播放」的时间。生成再快,一句十几个词的英文念完仍然要好几秒,而这段时间和引擎无关,只和句子长度有关。想缩短它只有一个办法:让句子变短。
影响体验的几个参数
- 语速:Google Cloud Text-to-Speech 的
speakingRate取值范围是 0.25 到 2.0,1.0 是该音色的原生语速。往上调一点(1.1 左右)能按比例缩短播放时间;听感损失多大取决于音色和语种,没有通用答案,自己听一遍再决定。 - 音色:通用音色和克隆音色的差异不只在自然度,也在延迟。
- 停顿处理:好的 TTS 会在标点处给出合理停顿。译文里如果标点丢失,播报会连成一片,可懂度显著下降。
- 数字与单位的读法:「30ml」应该读成「thirty millilitres」还是「three zero m l」,不同引擎处理不同,直播里价格和规格出现频率极高,这一项值得单独测。
流式合成
和识别一样,合成也分流式和非流式。流式合成边生成边播放,可以在整句还没生成完时就开始出声,明显降低感知延迟。如果你的方案支持,应该开启。