

选直播翻译工具最没用的做法是看演示视频,其次是看厂商标称的准确率。有用的做法只有一个:让所有候选方案跑同一段你自己的音频。
这套流程跑完大约需要半天,产出是一组可比的数字,以及一个更重要的东西——你会知道问题出在哪一环。
为什么必须自己录基准音频
厂商演示里的音频通常是干净人声、标准语速、没有背景音乐。直播音频这三条都不满足:有音乐、语速偏快、麦克风离嘴距离不固定。在这三个条件下,不同方案的排序经常和演示里的排序不一样。
基准音频的要求很具体:
- 十分钟真实开播录音,覆盖讲解、报价、互动三种节奏;
- 包含你关心的全部品牌名与型号,这是术语表能力的唯一考场;
- 不要用朗读稿子的录音,朗读的语速和连读程度都比真实口播轻得多。
录制规范:关掉降噪,这不是笔误
Google 的语音识别最佳实践文档里有几条反直觉但很明确的要求,基准音频要按它录一次:
- 采样率 16 kHz 或更高,并且避免重采样——如果音源本身就是 8 kHz,就按 8 kHz 送,不要升采样;
- 使用无损编码,推荐 FLAC 或 LINEAR16;必须省带宽时优先 AMR_WB 或 OGG_OPUS;
- 不要使用自动增益控制(AGC);
- 关闭全部降噪处理;
- 避免削波,麦克风尽量靠近说话人。
关降噪这一条最容易被当成写反了。官方给的理由是:识别服务本身就是按含噪音频设计的,在送进服务之前做降噪处理通常会降低识别准确率。开着降噪测出来的数字,既不代表这些工具的真实能力,也不代表你线上的表现。
词错率:定义、算法与工具
词错率(WER)是行业通用指标,微软的官方定义是:把插入、删除、替换三类错误的数量加起来,除以人工转写文本的总词数。
WER = (I + D + S) / N × 100
- 插入(I):识别结果里多出来的词;
- 删除(D):参考文本里有、识别结果里没有的词;
- 替换(S):被识别成了另一个词。
想在本地复算,微软官方推荐的是 NIST 评分工具包(SCTK)里的 sclite。中文场景通常用字错率(CER),把「词」换成「字」,公式和三类错误的划分完全一致。
判断标准。 微软给出的通用分级是:5% 到 10% 属于良好、可以投入使用;20% 尚可接受,但建议继续优化;30% 以上属于质量不佳。这套分级面向通用场景,直播带货对品牌名和数字的错误更敏感,实际验收标准通常还要更严一些——具体到哪个阈值,取决于你的品类,本站在语音识别那篇里给的是更保守的经验值。
三类错误的分布比总分更有用
这是整套流程里最值得记住的一条。微软的官方文档直接给出了错误类型与根因的对应关系:
| 主导的错误类型 | 说明的问题 | 该动哪里 |
|---|---|---|
| 删除偏多 | 音频信号偏弱 | 把拾音拉近,检查增益 |
| 插入偏多 | 录制环境嘈杂、存在串音 | 处理背景音与其他人声 |
| 替换偏多 | 领域术语样本不足 | 补术语表或做自定义模型 |
这张表把「测评」变成了「诊断」。两个工具的总分可能都是 12%,但一个是删除主导、另一个是替换主导——前者说明你的麦克风摆位有问题,换工具解决不了;后者说明术语表还没配好,是可以补的。
先按这张表定位,再决定要不要继续比工具。 如果三个候选方案的错误都以删除为主,那么真正该做的是调拾音,此时的横向对比没有意义。
显示形态要单独看
词错率算的是词,不管标点、大小写和数字格式。但字幕里观众看到的恰恰是这些。
微软为此定义了一个扩展指标——词元错误率(TER),它在词的基础上把标点、大小写和逆文本规范化的差异一并计入。实践中不必自己实现它,但要意识到:一个 WER 很好的方案,仍然可能因为把价格格式化成了奇怪的写法而不可用。 验收时把识别文本里的价格、时间、尺码单独挑出来看一遍,这一项肉眼就能判断。
延迟、长时段与断线,短样本测不出来
十分钟的基准音频能筛掉明显更差的方案,但下面三件事必须单独测。
延迟。 口径要统一成「开口到译音播完」,不是「开口到出字幕」。方法是本地双轨录制,量原声起点到译音终点的间隔,重复十次取中位数而不是平均值。
长时段稳定性。 按你真实的场次长度连续跑一次。这一项要观察的不是准确率,而是有没有累积性的退化:内存增长、音画漂移、识别越到后面越慢。
断线恢复。 中途拔一次网线,记录三件事:多久重连、重连后是否丢句、以及主播端有没有任何可见的提示。最后一条最容易被忽略——如果工具静默失败,主播会在完全不知情的情况下对着没有翻译的观众继续讲十分钟。
成本记口径,不要记价格
价格随时会变,写进评测表几个月后就是错的。要记的是口径:
- 计费单位是按分钟、按字符还是按订阅?
- 语音合成是否单独计费?克隆音色是否另计?
- 超出套餐的部分怎么算?
- 是否有并发数限制?
同样口径下再折算成「每小时直播的直接成本」,不同方案才可比。
一张可以直接照抄的记录表
每个候选方案记这几列,跑完就能做决定:
| 列 | 记什么 |
|---|---|
| 字/词错率 | 同一段基准音频上的总分 |
| I / D / S 分布 | 三类错误各自的数量 |
| 品牌名命中 | 目标术语有几个被正确识别 |
| 价格显示形态 | 是否出现无法接受的格式 |
| 延迟中位数 | 开口到译音播完,十次取中位 |
| 长时段表现 | 一场真实时长内有无退化 |
| 断线恢复 | 重连耗时、是否丢句、有无提示 |
| 成本口径 | 计费单位与不含项 |
这张表跑完,你手上就不是「哪个更好」的模糊印象,而是一组能对着约束条件做取舍的事实。哪一列不达标决定了下一步该改硬件、改术语表,还是换方案。
操作步骤
- 1
录一段有代表性的基准音频
从真实开播里录十分钟,覆盖讲解、报价、互动三种节奏,并包含你关心的全部品牌名与型号。不要用朗读稿子的录音,它的语速和连读程度都不具代表性。
- 2
按官方录音规范准备这段音频
Google 的语音识别最佳实践要求采样率 16 kHz 或更高、避免重采样、使用 FLAC 或 LINEAR16 这类无损编码,并且明确要求关闭自动增益控制与全部降噪处理。基准音频要按这个规范录一次,之后所有工具共用它。
- 3
人工写出参考文本
逐句听写这段音频,得到一份准确的参照转写。这份文本是后面所有数字的分母,写错一处会污染全部对比结果,值得花时间校对两遍。
- 4
让每个候选方案跑同一段音频并导出结果
逐个工具处理这段音频,导出识别文本与译文。条件必须完全一致:同一个文件、同一套术语表配置、同一个语言对方向,任何一项不同都会让对比失效。
- 5
计算词错率并拆出三类错误
词错率的定义是插入、删除、替换三类错误数之和除以参考文本的总词数。想在本地复算,微软官方推荐 NIST 评分工具包 SCTK 里的 sclite。只看总分不够,要拿到三类错误各自的数量。
- 6
按错误类型定位问题环节
微软官方给出的对应关系是:删除类错误多通常意味着音频信号偏弱,应把拾音拉近;插入类错误多说明录制环境嘈杂或存在串音;替换类错误多则是领域术语覆盖不足。据此决定该改硬件还是改术语表。
- 7
单独测延迟、长时段与断线恢复
用本地双轨录制量「开口到译音播完」的间隔,重复十次取中位数;再连续跑满一场真实时长,中途断一次网,记录它多久恢复、恢复后是否丢句。
- 8
记录成本口径而不是价格
记下计费单位是按分钟、按字符还是按订阅,是否包含语音合成,以及超量部分怎么计。价格会变,口径不会,只有口径能让不同方案横向可比。
常见问题
- 词错率到多少才算能用?
- 微软给出的通用分级是 5% 到 10% 属于良好、可以投入使用,20% 尚可接受但建议继续优化,30% 以上属于质量不佳。直播带货对错字更敏感,实际验收标准通常要比这套通用分级更严。
- 为什么厂商演示效果很好,自己测就差很多?
- 演示音频通常是干净人声、标准语速、没有背景音乐,而直播音频三条都不满足。这也是必须用自己的录音做基准的原因——唯一有参考价值的数字来自你自己的直播间。
- 录基准音频时该不该开降噪?
- 不该。Google 的官方最佳实践明确要求关闭全部降噪处理和自动增益控制,并说明前置降噪通常会降低识别准确率,因为服务本身就是按含噪音频设计的。开着降噪测出来的数字不代表线上表现。
- 十分钟的样本够不够?
- 够做工具间的横向筛选,不够做绝对质量结论。十分钟能稳定区分出明显更差的方案;要判断某一个方案能不能长期用,还需要补上长时段稳定性和断线恢复这两项,它们在短样本里根本不会出现。

