跳到主要内容
OT

声音克隆

别称:音色克隆 · Voice Cloning · 声纹复刻

声音克隆是用少量目标说话人的录音,训练或适配出一个可复用音色的技术。在跨境直播里,它让译音听起来仍是主播本人,从而保持直播间的人格连续性。

同语种与跨语种

同语种克隆(中文声音说中文)技术上已经相当成熟。

跨语种克隆(中文声音说英文、印尼语、越南语)差异很大,通常越是小语种效果越差。评估时一定要用你自己的声音试听目标语种,厂商演示样本挑的是效果最好的组合。

代价

  • 延迟更高。 克隆音色的合成通常慢于通用音色,短句场景下这个增量占比尤其明显。
  • 情绪单一。 直播的语气变化很丰富,而克隆音色大多只能维持一个相对稳定的语气。
  • 语种覆盖窄。 支持的目标语言通常少于通用音色。

合规边界

克隆自己的声音需要本人明确、可留痕的授权;克隆他人声音(含员工、合作主播、公众人物)未经授权即构成侵权。《民法典》第一千零二十三条第二款规定,对自然人声音的保护,参照适用肖像权保护的有关规定。

这里有一个容易踩的坑:拿到录音的使用授权,不等于拿到用这段录音做 AI 克隆的授权。 北京互联网法院 2024 年宣判的全国首例 AI 生成声音人格权侵权案((2023) 京 0491 民初 12142 号)认定的正是这一点——配音演员当初授权的是录音制品的使用,不包括把录音交给第三方做声音 AI 化处理;只要合成音色能让一般听众联想到本人,就落入声音权益的保护范围。

即使用的是自己的声音,用合成语音发表本人未说过的商业承诺(价格、功效、售后条款),责任仍然归属于你。稳妥的做法是把克隆音色限定为「本人内容的翻译转述」。