跳到主要内容
OT

术语表

跨境直播与实时翻译的核心术语,按字母顺序排列。

词错率(WER)
词错率(Word Error Rate,WER)是衡量语音识别准确度的通用指标,等于插入、删除、替换三类错误的数量之和除以人工转写文本的总词数。中文场景通常改用以字为单位的字错率(CER)。
别称:WER · 字错率 · CER · Word Error Rate
端到端延迟
端到端延迟指从主播开口到海外观众理解译文之间的总耗时。常见有两种口径:开口到出字幕,以及开口到译音播完,两者能相差数秒,脱离口径的延迟数字无法比较。
别称:E2E 延迟 · 总延迟 · 翻译延迟
色键(Chroma Key)
色键(Chroma Key)是按颜色把画面中特定区域变为透明的技术。在直播字幕方案里,翻译工具输出纯绿背景的字幕窗口,OBS 捕获后用色键抠掉绿色,只把文字叠在画面上。
别称:绿幕抠像 · Chroma Key · 色度键
声音克隆
声音克隆是用少量目标说话人的录音,训练或适配出一个可复用音色的技术。在跨境直播里,它让译音听起来仍是主播本人,从而保持直播间的人格连续性。
别称:音色克隆 · Voice Cloning · 声纹复刻
虚拟声卡
虚拟声卡是一对成套的软件音频设备,包含一个虚拟输出和一个虚拟输入。写进虚拟输出的音频会原样出现在虚拟输入里,从而把一个程序的声音直接送给另一个程序,不经过物理扬声器和麦克风。
别称:VB-Cable · BlackHole · 虚拟音频线 · Virtual Audio Cable
语音合成(TTS)
语音合成(Text-to-Speech,TTS)是把文本转换成语音的技术。在直播实时翻译里,它负责把译文朗读出来,其耗时大致与译文长度成正比,是端到端延迟的主要来源之一。
别称:TTS · 文本转语音 · 语音播报
语音识别(ASR)
语音识别(Automatic Speech Recognition,ASR)是把语音信号转换成文本的技术。在直播实时翻译里,它是链路的第一环,输出的文本直接决定后续翻译的上限。
别称:ASR · 自动语音识别 · 语音转文字