---
title: "直播翻译工具怎么测试：可复现的验收流程"
description: "用一段固定音频跑完所有候选方案，算词错率并按错误类型定位问题，同时测延迟、长时段稳定性与成本口径。"
canonical: https://obstrans.net/zh/blog/evaluating-live-translation-tools
language: zh
topic: tool-reviews
published: 2026-08-08
keywords: 词错率, WER, 工具评测, 基准音频, 直播翻译
---

# 直播翻译工具怎么测试：可复现的验收流程

> 试用直播翻译工具的关键是让所有候选跑同一段真实音频。词错率给出可比的数字，而插入、删除、替换三类错误的分布直接指向问题出在拾音、环境噪声还是术语覆盖，比总分更有用。

选直播翻译工具最没用的做法是看演示视频，其次是看厂商标称的准确率。**有用的做法只有一个：让所有候选方案跑同一段你自己的音频。**

这套流程跑完大约需要半天，产出是一组可比的数字，以及一个更重要的东西——你会知道问题出在哪一环。

## 为什么必须自己录基准音频

厂商演示里的音频通常是干净人声、标准语速、没有背景音乐。直播音频这三条都不满足：有音乐、语速偏快、麦克风离嘴距离不固定。在这三个条件下，不同方案的排序经常和演示里的排序不一样。

基准音频的要求很具体：

- **十分钟真实开播录音**，覆盖讲解、报价、互动三种节奏；
- **包含你关心的全部品牌名与型号**，这是术语表能力的唯一考场；
- **不要用朗读稿子的录音**，朗读的语速和连读程度都比真实口播轻得多。

## 录制规范：关掉降噪，这不是笔误

Google 的语音识别最佳实践文档里有几条反直觉但很明确的要求，基准音频要按它录一次：

- **采样率 16 kHz 或更高**，并且避免重采样——如果音源本身就是 8 kHz，就按 8 kHz 送，不要升采样；
- **使用无损编码**，推荐 FLAC 或 LINEAR16；必须省带宽时优先 AMR_WB 或 OGG_OPUS；
- **不要使用自动增益控制（AGC）**；
- **关闭全部降噪处理**；
- **避免削波**，麦克风尽量靠近说话人。

关降噪这一条最容易被当成写反了。官方给的理由是：识别服务本身就是按含噪音频设计的，**在送进服务之前做降噪处理通常会降低识别准确率**。开着降噪测出来的数字，既不代表这些工具的真实能力，也不代表你线上的表现。

## 词错率：定义、算法与工具

词错率（WER）是行业通用指标，微软的官方定义是：把插入、删除、替换三类错误的数量加起来，除以人工转写文本的总词数。

```
WER = (I + D + S) / N × 100
```

- **插入（I）**：识别结果里多出来的词；
- **删除（D）**：参考文本里有、识别结果里没有的词；
- **替换（S）**：被识别成了另一个词。

想在本地复算，微软官方推荐的是 NIST 评分工具包（SCTK）里的 `sclite`。中文场景通常用字错率（CER），把「词」换成「字」，公式和三类错误的划分完全一致。

**判断标准。** 微软给出的通用分级是：5% 到 10% 属于良好、可以投入使用；20% 尚可接受，但建议继续优化；30% 以上属于质量不佳。这套分级面向通用场景，直播带货对品牌名和数字的错误更敏感，实际验收标准通常还要更严一些——具体到哪个阈值，取决于你的品类，本站在语音识别那篇里给的是更保守的经验值。

## 三类错误的分布比总分更有用

这是整套流程里最值得记住的一条。微软的官方文档直接给出了错误类型与根因的对应关系：

| 主导的错误类型 | 说明的问题 | 该动哪里 |
| --- | --- | --- |
| 删除偏多 | 音频信号偏弱 | 把拾音拉近，检查增益 |
| 插入偏多 | 录制环境嘈杂、存在串音 | 处理背景音与其他人声 |
| 替换偏多 | 领域术语样本不足 | 补术语表或做自定义模型 |

这张表把「测评」变成了「诊断」。两个工具的总分可能都是 12%，但一个是删除主导、另一个是替换主导——前者说明你的麦克风摆位有问题，换工具解决不了；后者说明术语表还没配好，是可以补的。

**先按这张表定位，再决定要不要继续比工具。** 如果三个候选方案的错误都以删除为主，那么真正该做的是调拾音，此时的横向对比没有意义。

## 显示形态要单独看

词错率算的是词，不管标点、大小写和数字格式。但字幕里观众看到的恰恰是这些。

微软为此定义了一个扩展指标——词元错误率（TER），它在词的基础上把标点、大小写和逆文本规范化的差异一并计入。实践中不必自己实现它，但要意识到：**一个 WER 很好的方案，仍然可能因为把价格格式化成了奇怪的写法而不可用。** 验收时把识别文本里的价格、时间、尺码单独挑出来看一遍，这一项肉眼就能判断。

## 延迟、长时段与断线，短样本测不出来

十分钟的基准音频能筛掉明显更差的方案，但下面三件事必须单独测。

**延迟。** 口径要统一成「开口到译音播完」，不是「开口到出字幕」。方法是本地双轨录制，量原声起点到译音终点的间隔，重复十次取中位数而不是平均值。

**长时段稳定性。** 按你真实的场次长度连续跑一次。这一项要观察的不是准确率，而是有没有累积性的退化：内存增长、音画漂移、识别越到后面越慢。

**断线恢复。** 中途拔一次网线，记录三件事：多久重连、重连后是否丢句、以及主播端有没有任何可见的提示。最后一条最容易被忽略——如果工具静默失败，主播会在完全不知情的情况下对着没有翻译的观众继续讲十分钟。

## 成本记口径，不要记价格

价格随时会变，写进评测表几个月后就是错的。要记的是口径：

- 计费单位是按分钟、按字符还是按订阅？
- 语音合成是否单独计费？克隆音色是否另计？
- 超出套餐的部分怎么算？
- 是否有并发数限制？

同样口径下再折算成「每小时直播的直接成本」，不同方案才可比。

## 一张可以直接照抄的记录表

每个候选方案记这几列，跑完就能做决定：

| 列 | 记什么 |
| --- | --- |
| 字/词错率 | 同一段基准音频上的总分 |
| I / D / S 分布 | 三类错误各自的数量 |
| 品牌名命中 | 目标术语有几个被正确识别 |
| 价格显示形态 | 是否出现无法接受的格式 |
| 延迟中位数 | 开口到译音播完，十次取中位 |
| 长时段表现 | 一场真实时长内有无退化 |
| 断线恢复 | 重连耗时、是否丢句、有无提示 |
| 成本口径 | 计费单位与不含项 |

这张表跑完，你手上就不是「哪个更好」的模糊印象，而是一组能对着约束条件做取舍的事实。哪一列不达标决定了下一步该改硬件、改术语表，还是换方案。

## Steps

1. **录一段有代表性的基准音频** — 从真实开播里录十分钟，覆盖讲解、报价、互动三种节奏，并包含你关心的全部品牌名与型号。不要用朗读稿子的录音，它的语速和连读程度都不具代表性。
2. **按官方录音规范准备这段音频** — Google 的语音识别最佳实践要求采样率 16 kHz 或更高、避免重采样、使用 FLAC 或 LINEAR16 这类无损编码，并且明确要求关闭自动增益控制与全部降噪处理。基准音频要按这个规范录一次，之后所有工具共用它。
3. **人工写出参考文本** — 逐句听写这段音频，得到一份准确的参照转写。这份文本是后面所有数字的分母，写错一处会污染全部对比结果，值得花时间校对两遍。
4. **让每个候选方案跑同一段音频并导出结果** — 逐个工具处理这段音频，导出识别文本与译文。条件必须完全一致：同一个文件、同一套术语表配置、同一个语言对方向，任何一项不同都会让对比失效。
5. **计算词错率并拆出三类错误** — 词错率的定义是插入、删除、替换三类错误数之和除以参考文本的总词数。想在本地复算，微软官方推荐 NIST 评分工具包 SCTK 里的 sclite。只看总分不够，要拿到三类错误各自的数量。
6. **按错误类型定位问题环节** — 微软官方给出的对应关系是：删除类错误多通常意味着音频信号偏弱，应把拾音拉近；插入类错误多说明录制环境嘈杂或存在串音；替换类错误多则是领域术语覆盖不足。据此决定该改硬件还是改术语表。
7. **单独测延迟、长时段与断线恢复** — 用本地双轨录制量「开口到译音播完」的间隔，重复十次取中位数；再连续跑满一场真实时长，中途断一次网，记录它多久恢复、恢复后是否丢句。
8. **记录成本口径而不是价格** — 记下计费单位是按分钟、按字符还是按订阅，是否包含语音合成，以及超量部分怎么计。价格会变，口径不会，只有口径能让不同方案横向可比。

## FAQ

### 词错率到多少才算能用？

微软给出的通用分级是 5% 到 10% 属于良好、可以投入使用，20% 尚可接受但建议继续优化，30% 以上属于质量不佳。直播带货对错字更敏感，实际验收标准通常要比这套通用分级更严。

### 为什么厂商演示效果很好，自己测就差很多？

演示音频通常是干净人声、标准语速、没有背景音乐，而直播音频三条都不满足。这也是必须用自己的录音做基准的原因——唯一有参考价值的数字来自你自己的直播间。

### 录基准音频时该不该开降噪？

不该。Google 的官方最佳实践明确要求关闭全部降噪处理和自动增益控制，并说明前置降噪通常会降低识别准确率，因为服务本身就是按含噪音频设计的。开着降噪测出来的数字不代表线上表现。

### 十分钟的样本够不够？

够做工具间的横向筛选，不够做绝对质量结论。十分钟能稳定区分出明显更差的方案；要判断某一个方案能不能长期用，还需要补上长时段稳定性和断线恢复这两项，它们在短样本里根本不会出现。

