术语表
跨境直播与实时翻译的核心术语,按字母顺序排列。
- 词错率(WER)
- 词错率(Word Error Rate,WER)是衡量语音识别准确度的通用指标,等于插入、删除、替换三类错误的数量之和除以人工转写文本的总词数。中文场景通常改用以字为单位的字错率(CER)。
- 别称:WER · 字错率 · CER · Word Error Rate
- 端到端延迟
- 端到端延迟指从主播开口到海外观众理解译文之间的总耗时。常见有两种口径:开口到出字幕,以及开口到译音播完,两者能相差数秒,脱离口径的延迟数字无法比较。
- 别称:E2E 延迟 · 总延迟 · 翻译延迟
- 色键(Chroma Key)
- 色键(Chroma Key)是按颜色把画面中特定区域变为透明的技术。在直播字幕方案里,翻译工具输出纯绿背景的字幕窗口,OBS 捕获后用色键抠掉绿色,只把文字叠在画面上。
- 别称:绿幕抠像 · Chroma Key · 色度键
- 声音克隆
- 声音克隆是用少量目标说话人的录音,训练或适配出一个可复用音色的技术。在跨境直播里,它让译音听起来仍是主播本人,从而保持直播间的人格连续性。
- 别称:音色克隆 · Voice Cloning · 声纹复刻
- 虚拟声卡
- 虚拟声卡是一对成套的软件音频设备,包含一个虚拟输出和一个虚拟输入。写进虚拟输出的音频会原样出现在虚拟输入里,从而把一个程序的声音直接送给另一个程序,不经过物理扬声器和麦克风。
- 别称:VB-Cable · BlackHole · 虚拟音频线 · Virtual Audio Cable
- 语音合成(TTS)
- 语音合成(Text-to-Speech,TTS)是把文本转换成语音的技术。在直播实时翻译里,它负责把译文朗读出来,其耗时大致与译文长度成正比,是端到端延迟的主要来源之一。
- 别称:TTS · 文本转语音 · 语音播报
- 语音识别(ASR)
- 语音识别(Automatic Speech Recognition,ASR)是把语音信号转换成文本的技术。在直播实时翻译里,它是链路的第一环,输出的文本直接决定后续翻译的上限。
- 别称:ASR · 自动语音识别 · 语音转文字