跳到主要内容
OT
跨境直播运营

跨境直播话术怎么本地化:四类必改的表达

称呼、倒计时、促销机制、谐音梗这四类中文直播话术在翻译链路上会怎么坏掉,以及分别该改成什么说法。

研究所编辑部约 4 分钟读完
示意图:一个多面体经过中间的转换节点后变成另一个形状不同的多面体,原形轮廓以淡线叠在新形状后面

跨境直播的话术问题很少是「翻译不准」。更常见的情况是:某些中文表达在经过识别与合成之后,已经不再是一句有意义的话了。这类问题换翻译引擎解决不了,只能改话术本身。

下面四类是必须重写的,不是翻译的问题。

第一类:称呼与集体指代

「家人们」「宝宝们」「老铁」「亲」这类称呼,在中文直播间里承担的是建立熟悉感和推动行动的功能,字面意思几乎不参与表达。逐字译过去,观众收到的是一个与语境无关的亲属称谓。

这一类没法用术语表修。Azure 对 dynamic dictionary 的适用范围写得很明确:这个功能只对专有名词、产品名这类复合名词是安全的。称呼语和语气词不在其中,硬塞进词表通常只会得到另一种别扭的固定译法。

可行的做法是按功能替换:想建立熟悉感就直接称呼观众群体,想推动行动就直接给动作指令。这是一次改写,改完之后中英两版话术就不再是逐句对应的关系了,这是正常的,也是本地化和翻译的分界线。

第二类:数字、价格与倒计时

这一类失败得最隐蔽,因为它坏在识别层而不是翻译层。

主流识别服务都会做逆文本规范化(Inverse Text Normalization,ITN):把口语说出的数字转成书面符号形态。Azure 的官方文档给了很直观的例子——说出口的 nine hundred dollars 会变成显示文本里的 $900six forty five p m 会变成 6:45 PM。更关键的是文档里的这句话:这个过程由服务完成,并且不可配置。

这带来两个实际后果:

  • 你无法控制价格的显示形态。 字幕里出现的是服务判断出来的写法,不是你说的那种写法。
  • 说得越快、越连读,判断越容易出错。 「三十九块九」快速念出来时,识别层要先切对词,才谈得上规范化,切错了后面全错。

倒计时是同一个问题的极端形式。「三、二、一,上链接」里的三个数字之间几乎没有停顿,而这个节奏恰恰是话术的意义所在。译音管线跑完这一串的时候,链接窗口往往已经过去了。

处理办法只有话术层面:

  • 价格单独成句,前后留出停顿,不要挂在长句的中间;
  • 数字放慢半拍,尺码、折扣、库存这几类同样处理;
  • 倒计时不要指望译音跟上,把动作指令提前独立说一遍,倒计时只留给画面和原声。

第三类:促销机制词

「满减」「凑单」「拍下改价」「预售定金」「战报」这些词的困难不在语言,在于目标市场不存在同构的机制。译出来的是一个字面正确、但观众无法执行的说法。

这一类要做的不是找译法,是判断:

  1. 这个机制在目标平台上存在吗?不存在就整段删掉,不要翻译一个观众点不到的按钮;
  2. 存在但叫法不同的,用目标平台自己的官方叫法,不要用直译;
  3. 机制本身要解释的,把它拆成动作步骤讲,而不是给一个名词。

第 3 条最容易被跳过。中文观众听到「凑单」就知道整个流程,海外观众听到的是一个陌生名词加一段没有前因后果的操作要求。

第四类:谐音梗与近音词

谐音在识别层就已经崩了。识别系统按最可能的词输出,它不会保留你想要的那个双关;到了翻译层,输入已经是被解掉的那个字面词。双关是不可能穿过这条链路的,不需要试。

近音词还有一个更少被提到的风险:敏感词过滤。Azure 的识别服务默认开启 Masked 模式,把判定为不雅的词替换成星号,并且官方注明微软保留屏蔽任何被认为不适当的词的权利——无论你是否开启了这个过滤。也就是说,某些近音表达可能在你不知情的情况下变成一串星号出现在字幕里。

同样值得知道的是语气词会被删掉。识别服务通常带有不流利内容移除功能,会去掉「嗯」「那个」这类填充词和重复。对逐字稿是好事,但如果你的话术依赖重复来强调(「真的真的很划算」),强调会在文本层被抹平。

其余话术:两条改写规则就够

不属于上面四类的部分,不需要重写,按两条规则调整即可。

规则一:一句话只放一件事。 译音是串行播放的,长句同时拉长断句等待和播放时间,而这两段本来就是端到端延迟里最大的部分。把「这个颜色特别显白,而且它是今天全场唯一一个还有库存的」拆成两句,观众端的到达时间会明显提前。

规则二:名词优先于代词。 「这个」「那个」「它」在中文直播里靠画面消解歧义,但翻译是按文本做的,拿不到画面。而且译音比原声晚几秒,观众听到「它」的时候,主播手上拿的可能已经是下一件商品了。把代词换回商品名,成本是几个字,收益是消除一整类误解。

这两条同时也在改善识别质量——短句更容易被正确断句,具体名词更容易命中术语表。

怎么验证话术改对了

不要用回译。把中文译成英文再译回中文,只能验证机器翻译的自洽性,验证不了目标观众能不能听懂。

有效的检查只有一种:找一个目标市场的人,只听十分钟译音,不看画面,然后复述你在卖什么、多少钱、怎么下单。 这三件事复述不出来,话术就没有过关,跟翻译准确率无关。

如果暂时找不到人,退而求其次的自查是:把这十分钟的译音文本打印出来,删掉所有代词,看剩下的文本还能不能读懂。读不懂的地方,就是观众需要靠画面猜的地方——而他们听到译音时,画面已经翻篇了。

常见问题

「家人们」用英文该怎么说?
不要找对应词,直接换成功能等价的开场。这个称呼在中文直播里的作用是建立熟悉感和催促行动,英文里承担同样功能的是直接称呼观众并给出动作指令,而不是任何一个亲属称谓的译法。
为什么价格总是被翻错或者显示成奇怪的格式?
多数识别服务带有逆文本规范化,会把口语说出的数字自动转成书面符号形态。Azure 官方文档明确写明这个过程不可配置。所以价格要靠话术处理:单独成句、放慢、必要时重复一遍。
话术改短会不会显得生硬?
短句在有译音的直播间里不是风格问题而是可懂度问题。译音是串行播放的,长句会同时拉长断句等待与播放时间;而二语观众处理长句的负担本来就更大。改短的收益远大于语感损失。
能不能用术语表把口头禅固定成某个译法?
一般不能。Azure 官方对 dynamic dictionary 的限定是它只对专有名词、产品名这类复合名词安全。口头禅、语气词、动词短语不属于这个范围,把它们塞进术语表通常会得到更奇怪的结果。
关键词直播话术本地化跨境直播逆文本规范化话术改写

查看本页 Markdown 原文