跳到主要内容
OT
工具评测与对比

直播翻译工具怎么测试:可复现的验收流程

用一段固定音频跑完所有候选方案,算词错率并按错误类型定位问题,同时测延迟、长时段稳定性与成本口径。

研究所编辑部约 5 分钟读完
示意图:三台相同的测试装置立在同一张刻度底盘上,同一条发光输入线在一个节点分成三支分别接入

选直播翻译工具最没用的做法是看演示视频,其次是看厂商标称的准确率。有用的做法只有一个:让所有候选方案跑同一段你自己的音频。

这套流程跑完大约需要半天,产出是一组可比的数字,以及一个更重要的东西——你会知道问题出在哪一环。

为什么必须自己录基准音频

厂商演示里的音频通常是干净人声、标准语速、没有背景音乐。直播音频这三条都不满足:有音乐、语速偏快、麦克风离嘴距离不固定。在这三个条件下,不同方案的排序经常和演示里的排序不一样。

基准音频的要求很具体:

  • 十分钟真实开播录音,覆盖讲解、报价、互动三种节奏;
  • 包含你关心的全部品牌名与型号,这是术语表能力的唯一考场;
  • 不要用朗读稿子的录音,朗读的语速和连读程度都比真实口播轻得多。

录制规范:关掉降噪,这不是笔误

Google 的语音识别最佳实践文档里有几条反直觉但很明确的要求,基准音频要按它录一次:

  • 采样率 16 kHz 或更高,并且避免重采样——如果音源本身就是 8 kHz,就按 8 kHz 送,不要升采样;
  • 使用无损编码,推荐 FLAC 或 LINEAR16;必须省带宽时优先 AMR_WB 或 OGG_OPUS;
  • 不要使用自动增益控制(AGC)
  • 关闭全部降噪处理
  • 避免削波,麦克风尽量靠近说话人。

关降噪这一条最容易被当成写反了。官方给的理由是:识别服务本身就是按含噪音频设计的,在送进服务之前做降噪处理通常会降低识别准确率。开着降噪测出来的数字,既不代表这些工具的真实能力,也不代表你线上的表现。

词错率:定义、算法与工具

词错率(WER)是行业通用指标,微软的官方定义是:把插入、删除、替换三类错误的数量加起来,除以人工转写文本的总词数。

WER = (I + D + S) / N × 100
  • 插入(I):识别结果里多出来的词;
  • 删除(D):参考文本里有、识别结果里没有的词;
  • 替换(S):被识别成了另一个词。

想在本地复算,微软官方推荐的是 NIST 评分工具包(SCTK)里的 sclite。中文场景通常用字错率(CER),把「词」换成「字」,公式和三类错误的划分完全一致。

判断标准。 微软给出的通用分级是:5% 到 10% 属于良好、可以投入使用;20% 尚可接受,但建议继续优化;30% 以上属于质量不佳。这套分级面向通用场景,直播带货对品牌名和数字的错误更敏感,实际验收标准通常还要更严一些——具体到哪个阈值,取决于你的品类,本站在语音识别那篇里给的是更保守的经验值。

三类错误的分布比总分更有用

这是整套流程里最值得记住的一条。微软的官方文档直接给出了错误类型与根因的对应关系:

主导的错误类型 说明的问题 该动哪里
删除偏多 音频信号偏弱 把拾音拉近,检查增益
插入偏多 录制环境嘈杂、存在串音 处理背景音与其他人声
替换偏多 领域术语样本不足 补术语表或做自定义模型

这张表把「测评」变成了「诊断」。两个工具的总分可能都是 12%,但一个是删除主导、另一个是替换主导——前者说明你的麦克风摆位有问题,换工具解决不了;后者说明术语表还没配好,是可以补的。

先按这张表定位,再决定要不要继续比工具。 如果三个候选方案的错误都以删除为主,那么真正该做的是调拾音,此时的横向对比没有意义。

显示形态要单独看

词错率算的是词,不管标点、大小写和数字格式。但字幕里观众看到的恰恰是这些。

微软为此定义了一个扩展指标——词元错误率(TER),它在词的基础上把标点、大小写和逆文本规范化的差异一并计入。实践中不必自己实现它,但要意识到:一个 WER 很好的方案,仍然可能因为把价格格式化成了奇怪的写法而不可用。 验收时把识别文本里的价格、时间、尺码单独挑出来看一遍,这一项肉眼就能判断。

延迟、长时段与断线,短样本测不出来

十分钟的基准音频能筛掉明显更差的方案,但下面三件事必须单独测。

延迟。 口径要统一成「开口到译音播完」,不是「开口到出字幕」。方法是本地双轨录制,量原声起点到译音终点的间隔,重复十次取中位数而不是平均值。

长时段稳定性。 按你真实的场次长度连续跑一次。这一项要观察的不是准确率,而是有没有累积性的退化:内存增长、音画漂移、识别越到后面越慢。

断线恢复。 中途拔一次网线,记录三件事:多久重连、重连后是否丢句、以及主播端有没有任何可见的提示。最后一条最容易被忽略——如果工具静默失败,主播会在完全不知情的情况下对着没有翻译的观众继续讲十分钟。

成本记口径,不要记价格

价格随时会变,写进评测表几个月后就是错的。要记的是口径:

  • 计费单位是按分钟、按字符还是按订阅?
  • 语音合成是否单独计费?克隆音色是否另计?
  • 超出套餐的部分怎么算?
  • 是否有并发数限制?

同样口径下再折算成「每小时直播的直接成本」,不同方案才可比。

一张可以直接照抄的记录表

每个候选方案记这几列,跑完就能做决定:

记什么
字/词错率 同一段基准音频上的总分
I / D / S 分布 三类错误各自的数量
品牌名命中 目标术语有几个被正确识别
价格显示形态 是否出现无法接受的格式
延迟中位数 开口到译音播完,十次取中位
长时段表现 一场真实时长内有无退化
断线恢复 重连耗时、是否丢句、有无提示
成本口径 计费单位与不含项

这张表跑完,你手上就不是「哪个更好」的模糊印象,而是一组能对着约束条件做取舍的事实。哪一列不达标决定了下一步该改硬件、改术语表,还是换方案。

操作步骤

  1. 1

    录一段有代表性的基准音频

    从真实开播里录十分钟,覆盖讲解、报价、互动三种节奏,并包含你关心的全部品牌名与型号。不要用朗读稿子的录音,它的语速和连读程度都不具代表性。

  2. 2

    按官方录音规范准备这段音频

    Google 的语音识别最佳实践要求采样率 16 kHz 或更高、避免重采样、使用 FLAC 或 LINEAR16 这类无损编码,并且明确要求关闭自动增益控制与全部降噪处理。基准音频要按这个规范录一次,之后所有工具共用它。

  3. 3

    人工写出参考文本

    逐句听写这段音频,得到一份准确的参照转写。这份文本是后面所有数字的分母,写错一处会污染全部对比结果,值得花时间校对两遍。

  4. 4

    让每个候选方案跑同一段音频并导出结果

    逐个工具处理这段音频,导出识别文本与译文。条件必须完全一致:同一个文件、同一套术语表配置、同一个语言对方向,任何一项不同都会让对比失效。

  5. 5

    计算词错率并拆出三类错误

    词错率的定义是插入、删除、替换三类错误数之和除以参考文本的总词数。想在本地复算,微软官方推荐 NIST 评分工具包 SCTK 里的 sclite。只看总分不够,要拿到三类错误各自的数量。

  6. 6

    按错误类型定位问题环节

    微软官方给出的对应关系是:删除类错误多通常意味着音频信号偏弱,应把拾音拉近;插入类错误多说明录制环境嘈杂或存在串音;替换类错误多则是领域术语覆盖不足。据此决定该改硬件还是改术语表。

  7. 7

    单独测延迟、长时段与断线恢复

    用本地双轨录制量「开口到译音播完」的间隔,重复十次取中位数;再连续跑满一场真实时长,中途断一次网,记录它多久恢复、恢复后是否丢句。

  8. 8

    记录成本口径而不是价格

    记下计费单位是按分钟、按字符还是按订阅,是否包含语音合成,以及超量部分怎么计。价格会变,口径不会,只有口径能让不同方案横向可比。

常见问题

词错率到多少才算能用?
微软给出的通用分级是 5% 到 10% 属于良好、可以投入使用,20% 尚可接受但建议继续优化,30% 以上属于质量不佳。直播带货对错字更敏感,实际验收标准通常要比这套通用分级更严。
为什么厂商演示效果很好,自己测就差很多?
演示音频通常是干净人声、标准语速、没有背景音乐,而直播音频三条都不满足。这也是必须用自己的录音做基准的原因——唯一有参考价值的数字来自你自己的直播间。
录基准音频时该不该开降噪?
不该。Google 的官方最佳实践明确要求关闭全部降噪处理和自动增益控制,并说明前置降噪通常会降低识别准确率,因为服务本身就是按含噪音频设计的。开着降噪测出来的数字不代表线上表现。
十分钟的样本够不够?
够做工具间的横向筛选,不够做绝对质量结论。十分钟能稳定区分出明显更差的方案;要判断某一个方案能不能长期用,还需要补上长时段稳定性和断线恢复这两项,它们在短样本里根本不会出现。
关键词词错率WER工具评测基准音频直播翻译

查看本页 Markdown 原文