跳到主要内容
OT

语音识别(ASR)

别称:ASR · 自动语音识别 · 语音转文字

语音识别(Automatic Speech Recognition,ASR)是把语音信号转换成文本的技术。在直播实时翻译里,它是链路的第一环,输出的文本直接决定后续翻译的上限。

流式识别与非流式识别

非流式(批量)识别接收一段完整音频后返回结果,准确率通常更高,但必须等说完才开始处理,不适合直播。

流式识别边接收边输出,可以在主播说话的同时给出临时结果,并在后续不断修正。直播翻译必须用流式识别。

流式识别有两类输出:

  • 临时结果(partial):随时可能被推翻,适合驱动实时字幕的滚动显示;
  • 最终结果(final):系统认为这一句已经稳定,可以送去翻译。

理解这个区别很重要:翻译只能基于最终结果,而等待最终结果本身就是延迟的一部分。

衡量指标

中文一般用字错率(CER),英文用词错率(WER),都是「错误的字/词数 ÷ 总字/词数」。

需要注意的是,厂商公布的准确率几乎都是在干净音频、标准发音条件下测出来的。直播间的实测值通常比标称值差一大截。唯一有意义的数字,是你用自己的直播音频测出来的那个。

直播场景的特殊难点

背景音乐、快语速带来的连读、品牌名和型号这类未登录词、以及主播的口头自我纠正。这四项在会议场景下都不突出,在直播里全部集中出现。