跳到主要内容
OT
直播实时翻译

直播场景的语音识别为什么比会议难

分析直播音频对语音识别的四个特殊挑战:背景音乐、口播语速、品牌术语和无法重说,并给出可操作的改善手段。

研究所编辑部约 4 分钟读完
示意图:连续声波被采样成一排离散的柱状条,其中少数几条错位并拖出虚影,对应识别出错的字词

在实时翻译这条链路上,语音识别是唯一一段错了就无法挽回的环节。翻译错了,人工还能在弹幕里补一句;识别错了,后面的一切都在认真地翻译一个错误的句子。

会议场景的语音识别已经相当成熟,但那套经验搬到直播上会大量失效。原因是四个具体差异。

差异一:背景音乐

会议室是安静的,直播间几乎总在放音乐。

语音识别模型的训练数据大多是「相对干净的人声」,音乐是一种非常特殊的干扰——它有稳定的节奏和音高,模型容易把某些乐器音当成语音成分。微软在识别质量评估文档里给出的对照关系可以直接用来验证这一点:插入型错误多,指向的就是录音环境嘈杂、可能存在串音。如果你的错误清单里凭空多出来的字特别多,先查音乐而不是查模型。

「压低多少」这件事不用凭感觉,OBS 的官方混音器指南已经给了分区标准,技术细节页还标出了具体刻度:对齐电平在 -20 dBFS(这个值当初就是按人声平均电平选的),允许最大电平在 -9 dBFS。对应到操作上:

  • 人声的峰值落在黄区上端到红区下端(大致 -20 到 -9 dBFS),背景音乐和礼物音效留在绿区(-20 dBFS 以下)。这一条不需要额外工具,看 OBS 的混音器就能确认;
  • 或者干脆做成「音乐段」和「讲解段」交替,讲解时静音;
  • 如果音乐必须一直有,优先选没有人声的纯音乐,人声音乐是最坏的情况。

差异二:口播语速

直播带货的语速普遍快于日常对话,而且节奏不均匀——报价格时会突然加速,讲卖点时又会拖长。快多少没有可引用的统计,但影响是确定的,而且有一个官方旁证:微软在识别文档里把「语速明显快于或慢于平常」列为需要调整分段静音超时的典型场景,快语速会把好几句连成一个识别结果。

语速本身不是致命问题,问题是语速快会导致连读和吞音。「三十九块九」快速念出来接近「三十九块」,识别系统很难分辨。

这一点技术上很难解决,只能在话术上让步:涉及数字的部分刻意放慢。价格、尺码、折扣、库存数量,这四类信息值得单独放慢半拍。

差异三:品牌名和型号

这是最典型也最好解决的问题。「XX 精华 30ml 二代」这种表达里,品牌名往往是外来词或生造词,识别模型没见过。

解决办法是双层术语表

  • 识别层:把品牌名及其常见误识别写成映射,让识别系统优先输出正确写法;
  • 翻译层:把品牌名标记为不翻译(保留原文)或指定固定译法。

只做翻译层是很多团队的误区——如果识别阶段就把品牌名听错了,翻译层的术语表根本匹配不上。

术语表值得在开播前花一小时整理,这是投入产出比最高的一项准备工作。

差异四:不能重说

会议里说错了可以「我重复一下」,直播的节奏不允许频繁自我纠正,而且观众端看到的是持续输出的字幕流。

这意味着系统必须能容忍自我修正。主播说「这个是黑色——不对,是深灰色」,理想的系统应该输出「深灰色」,而不是把两个颜色都翻出去。目前大多数方案做不到,实际操作中只能靠主播减少口头纠正。

一个反直觉的建议

很多团队的第一反应是换更强的识别模型。但两家官方文档在拾音这件事上的说法出奇一致,而且都排在模型之前:

  • **Google 的语音识别最佳实践**要求把麦克风尽可能靠近说话人,同时明确要求关掉降噪和自动增益——理由是服务本身就是按带噪音频设计的,前处理通常反而降低准确率。很多人在系统或声卡软件里开着的「环境降噪」,方向是反的。
  • **微软的识别质量评估文档**把漏字类错误直接归因于音频信号强度不足,给出的处理办法也是「在离声源更近的位置采集」。

所以顺序很清楚:先把物理层做好——指向性麦克风、正确的增益、离嘴距离固定、关掉一切前处理。这几件事成本几乎为零,而且是先决条件:拾音不合格的时候,识别引擎之间的差距根本测不出来。

怎么量化你的识别质量

不要凭感觉。做法很简单:

  1. 录 10 分钟真实开播音频(不是朗读稿子);
  2. 让系统离线识别一遍,导出文本;
  3. 人工听一遍,标出错的字,并且按插入、删除、替换分开计数

微软给出的通用判据是:词错率 5% 到 10% 属于质量良好、可以直接用,20% 算可接受但值得继续改进,30% 以上就是质量差。直播带货对品牌名和数字的容错更低,实际验收线通常要比这套通用判据更紧,紧多少取决于你的品类。

比总分更有用的是那三类错误的分布,微软文档给了直接的对照:漏字多是信号强度不足,插字多是环境噪声和串音,替换多是领域术语覆盖不够。同样是 12% 的错误率,前两种换引擎没有用,第三种加术语表就能解决。完整的验收流程在工具评测那篇里。

常见问题

直播时该不该放背景音乐?
如果依赖实时翻译,讲解段落的音乐要压得足够低,或者干脆静音。有一个不用猜的判断办法:按 OBS 官方混音器指南的分区,人声峰值应该落在黄区上端到红区下端,背景音乐和提示音应该待在绿区,也就是 -20 dBFS 以下。音乐对语音识别的干扰远大于对人耳的干扰。
术语表能解决品牌名翻错的问题吗?
能解决大部分。术语表需要同时作用于识别和翻译两层:让识别认得这个词的发音,也让翻译知道这个词固定译成什么,只做一层效果有限。
用更贵的识别模型是不是就准了?
先看错误类型再决定。微软在识别质量评估文档里给了对照关系:漏字多说明音频信号强度不足,该做的是把拾音拉近;插字多说明环境噪声大、可能有串音;替换错误多才是术语覆盖不够。前两类换模型都救不回来。
关键词语音识别ASR术语表直播拾音识别准确率

查看本页 Markdown 原文