ElevenLabs 发布 Dubbing v2 模型,提升 AI 语音翻译质量
核心要点
- 新模型直接以原始音频表演为条件,保留 90 多种语言的音调、节奏和情感。
- 该公司的最新型号 Dubbing v2 采用了一种根本不同的语音翻译方法:它不像其前身那样根据文本转录进行工作,而是聆听原始音频性能并直接根据听到的内容调节其输出。
- 获得优势 → Dubbing v2 的工作方式有何不同 传统的人

新模型直接以原始音频表演为条件,保留 90 多种语言的音调、节奏和情感。
ElevenLabs 刚刚发布了自人工智能配音技术离开研究实验室以来最重大的升级。该公司的最新型号 Dubbing v2 采用了一种根本不同的语音翻译方法:它不像其前身那样根据文本转录进行工作,而是聆听原始音频性能并直接根据听到的内容调节其输出。
实际结果是翻译后的音频实际上听起来就像原始说话者用另一种语言说的那些话。语气、节奏、情感表达,全部保留下来。
凯莱金融是华尔街的优势,现在是任何人的优势——凯莱财经是您的代理人工智能投资研究终端。获得优势 →
Dubbing v2 的工作方式有何不同
传统的人工智能配音流程遵循可预测的顺序:将音频转录为文本,翻译文本,然后从翻译的脚本中合成新的语音。 Dubbing v2 跳过了中间人。通过直接对源音频进行调节,该模型可以捕获文本转录本无法编码的声音特征。
该模型支持 90 多种具有区域变体的语言。它可以检测和处理每个音频文件多达 32 个发言者,使其适用于从独奏播客剧集到具有重叠对话的合奏制作的所有内容。
更令人印象深刻的功能之一是同步感知翻译。该系统自动将语音定时与原始音频同步,从而消除了历来使专业配音变得如此昂贵和缓慢的艰苦的口型同步调整。它还保留了原始的背景音频,这意味着环境声音、音乐和音效不受影响地通过,而只有声带被翻译。
哪里可以使用以及费用是多少
ElevenLabs 正在通过两个平台分发 Dubbing v2。 ElevenCreative 的目标客户是希望在不聘请配音工作室的情况下接触多语言观众的个人创作者、YouTube 主播、播客和独立电影制作人。 ElevenProductions 为具有更大规模本地化需求的企业客户提供服务。
为了鼓励采用,ElevenLabs 与该模型一起启动了创作者配音合作伙伴计划。该计划在最初的 7 天促销期内提供最多 30 分钟的有限免费使用。
对于想要直接在自己的产品中构建配音的开发人员和大型组织,API 于 2026 年 8 月 6 日推出。同时,原始 Dubbing v1 仍然适用于成本敏感的项目,在这些项目中,对源性能的绝对保真度比在预算紧张的情况下大规模翻译内容更重要。
