端到端延迟
别称:E2E 延迟 · 总延迟 · 翻译延迟
端到端延迟指从主播开口到海外观众理解译文之间的总耗时。常见有两种口径:开口到出字幕,以及开口到译音播完,两者能相差数秒,脱离口径的延迟数字无法比较。
两种口径
- 开口到出字幕:主播说出第一个字,到译文字幕出现在画面上。
- 开口到译音播完:主播说出第一个字,到合成语音把这句译文读完。
第二个才是观众真正「听懂」的时刻。运营决策应该用第二个口径。
构成
端到端延迟由五段组成:断句等待、语音识别、机器翻译、语音合成、播放。其中机器翻译通常是最快的一段,断句等待和播放时间是大头。
不包含在内的部分
推流缓冲不算在端到端延迟里。OBS 和直播平台各自都有缓冲,观众看到的画面本身就比主播端晚几秒。但这段延迟对原声和译音是一致的,不影响「译音相对原声晚多少」,只影响绝对时间。
做互动设计(比如回答弹幕)时要把推流缓冲算进去;做音画同步时不用。
怎么测
开本地录制,说一句有明显爆破音的话(「三、二、一」很好用),用音频编辑软件量原声起点到译音终点的间隔。重复十次取中位数,不要取平均——偶发长尾会让平均值失去意义。