跳到正文
ElevenLabs Blog· Mati Staniszewski·· 9 天前精选AI 评分62

ElevenLabs 发布 Eleven v4 与 Eleven v4 Turbo 语音模型

Introducing Eleven v4, our most emotive model

AI 导读

ElevenLabs 发布情感表现更强的文本转语音模型 Eleven v4 及低延迟版本 Eleven v4 Turbo,两者支持超过 90 种语言,已在 ElevenAgents、ElevenCreative 和 ElevenAPI 上线。

推荐理由

官方给出 Eleven v4 与 Turbo 的延迟、盲测偏好和克隆门槛,可据此判断语音智能体的可用性变化。

正文 · AI 翻译

同一行文字,因说话方式不同,效果可能大相径庭。“我需要你保持冷静”这句话,由不同的人说出来,听起来应该截然不同——无论是医生温柔地对惊恐的患者说,还是游戏中的角色在跳入战场前对队友大喊。

今天我们推出 Eleven v4,这是我们迄今为止最具情感表现力的文本转语音模型,以及它的低延迟版本 Eleven v4 Turbo。

Eleven v4 被 Artificial Analysis 评为第一名1,在盲测一对一对比中,约 75% 的听众更偏好它而非竞品模型2。它旨在理解语气、节奏、情感、角色和上下文,生成的语音可以听起来戏剧化、温柔、急切、幽默或口语化,同时保持说话者的身份特征。更自然的多说话人动态让对话感觉有来有回,而不是把各自独立的台词拼凑在一起。说话者会回应对话的上下文,产生更自然的对话和角色互动。

为性能而生的全新架构

Eleven v4 基于全新的架构构建,是我们最具情感表现力的 文本转语音模型,被 Artificial Analysis 评为第一名1。Eleven v4 Turbo 将同样的技术带入智能体等低延迟用例。其中位推理延迟约为 100ms,响应速度比两个人对话时的平均停顿还快。

两个模型生成的语音都富有情感,而非机械感。底层音频保真度也全面提升,输出更干净、更自然。 

早期的文本转语音模型可以朗读文本,但 Eleven v4 为语音赋予了情感深度,听起来自然得多。该模型能够解读预期的语气、语音应有的节奏、文字的角色感以及文本中的上下文,从而传递出能引发情感共鸣的语音。

[兴奋,开心] 大家,重大消息。我们的夏季菜单这周五上线。没错,芒果糯米饭终于回归了。

0:00

[困倦慵懒的声音] 嗯,再睡五分钟。[打哈欠] 我保证这个梦一做完就起来。

0:00

用户还可以对输出进行细粒度控制,用自然语言描述某句台词应该怎么说。他们还可以添加具体指令,说明某些短语该怎么念、应该传达什么情感,甚至加入 音效,使用 [laughs]、[said angrily in French accent]、[light rain] 或 [phone buzzing] 这样的内联标签。Eleven v4 比之前的模型更准确地遵循这些音频标签和指导提示,所以你描述的表达方式就是最终得到的效果。这让指导旁白、丰满角色或其对话,以及其他表达方式很重要的场景都变得更加容易。 

ElevenLabs 开发者文档涵盖了完整的标签语法以及如何通过 API 应用这些标签。对国际音标(IPA)音素的支持也得到了显著改进,因此自定义发音的表现更加可靠。

Eleven v4 还在多说话人之间的一致性和动态对话方面带来了改进。Eleven v4 采用一种捕获说话人身份的新方法,保留了每个声音的独特品质。它能够在智能体对话、有声书或广告中保持语音的一致性。由于模型理解整个场景的上下文,它能生成自然的对话,让说话人回应刚刚说过的内容,而不是把孤立的台词拼接在一起。

面向低延迟用例的 Turbo 模型

高质量的语音模型往往生成语音较慢,这意味着用户不得不在快速或富有表现力的语音智能体之间做出选择。许多人选择了熟练但单调的智能体,而对于一个只想解决问题的烦躁客户来说,这种智能体可能显得很机械。 

Eleven v4 Turbo 将速度与情感结合在一起,首次发声的中位时间约为 150ms3,使得在无数行业中部署强大的智能体成为可能,从医疗保健中能够准确发音医学术语的温暖、令人安心的智能体,到游戏中用快语速、满口俚语的智能体来娱乐玩家。

Eleven v4 Turbo 模型专为与 ElevenLabs 的对话式智能体平台 ElevenAgents 配合使用而构建。其他智能体构建者将来自不同供应商的模型和软件拼接在一起,这意味着用户无法针对自己的用例来优化或改进模型输出。ElevenLabs 的研究和工程团队将 Eleven v4 Turbo 和 ElevenAgents 作为一个系统一起优化,提供更具表现力、更可靠且低延迟的智能体。  

一种声音,多种语言 

我们的沟通方式因情境、地点甚至一天中的时间而异。构建能够跨语言反映这一点的富有表现力的语音,仍然是音频 AI 中最艰巨的挑战之一。 

Eleven v4 在所有这些方面都有提升,而且改进不仅限于模型如何发音短语。Eleven v4 更好地捕捉跨语言的节奏、情感和表达方式,帮助创作者生成对语言和语境来说都自然的语音。例如,在日本与一位年长的陌生人说话的方式,与在意大利与他们说话的方式截然不同。 

Eleven v4 和 Eleven v4 Turbo 均支持 90 多种语言。现在,用一种语言录制的声音也能流利地说任何其他语言,采用母语者的口音,同时保留原声的身份特征。这种口音贴合度明显强于以往,因此声音在生成过程中不再漂移回其源口音。

加泰罗尼亚语

Sovint caminem per la vida amb la mirada fixada en l'horitzó, preocupats pel demà, sense adonar-nos que el miracle real està passant just sota els nostres peus.

0:00

西班牙语

El viento susurra historias olvidadas entre las hojas secas del parque. La ciudad aún duerme bajo un manto de neblina dorada, ajena al bullicio que pronto inundará sus calles. Un viejo farol parpadea por última vez antes de ceder su lugar a los primeros rayos del sol. En este preciso instante, el tiempo parece detenerse.

0:00

对于配音和本地化而言,这意味着你所选定的品牌声音——无论是你正在合作的明星演员,还是最符合你公司风格的语调——在 Eleven v4 支持的任何语言中都会听起来很棒。

更真实、更一致的语音克隆

在 Eleven v4 和 Eleven v4 Turbo 上,声音克隆更加真实、强大且一致,与原始源声音的说话人相似度显著提升。即时声音克隆现在只需 10 秒音频即可高保真地捕捉声音。 

真实声音

嘿,非常感谢您的等待。嗯,我现在已经把您的账户调出来了,看起来这笔扣款确实在 11 号扣了两次,是的,这绝对不应该发生。我现在就为您发起退款。

0:00

Eleven v4

嘿,非常感谢您的等待。嗯,我现在已经把您的账户调出来了,看起来这笔扣款确实在 11 号扣了两次,是的,这绝对不应该发生。嗯,我现在就为您发起退款。

0:00

Eleven v4 还能在多次生成、对话、旁白和重新生成的台词中更可靠地保持说话人身份。这意味着对于长篇项目,角色、旁白和克隆声音在整个制作过程中保持一致。Eleven v4 还新增了对专业声音克隆(PVC)的支持,以满足最高保真度的克隆用例。

请求拼接——将多次生成串联起来以制作更长篇幅的内容——在 Eleven v4 中也显著更加可靠,这提升了在 ElevenLabs Studio 和 ElevenLabs Reader App 中的使用体验。

亲自听听区别  

Eleven v4 和 Eleven v4 Turbo 是我们在富有表现力的语音生成方面最新研究的成果。它们专为表达方式与文字本身同样重要的内容而打造,无论是有声书、角色表演、配音、译制,还是对话式智能体的本地化。

这两款模型现已在 ElevenAgents、ElevenCreative 中以及通过 ElevenAPI 提供。创建免费账户,立即开始使用 Eleven v4 或 Eleven v4 Turbo 进行生成。

  1. Artificial Analysis,Provider Voice Arena 排行榜,2026 年 9 月
  2. 基于针对 Cartesia Sonic 3.6、Inworld TTS-2、Google Gemini 3.8 Flash-Lite TTS 和 Google Gemini 3.8 Flash TTS 的盲测一对一用户偏好测试,2026 年 9 月。对于每一组,评分者盲听来自 Eleven v4 和某个竞品的同一句台词,并判断哪个更具表现力、哪个听起来更自然;平局计半分。
  3. 从请求到可听语音的中位时间。2026 年 9 月使用相同脚本和默认设置,针对 Cartesia Sonic 3.6、xAI TTS、Google Gemini 3.8 Flash-Lite TTS 和 OpenAI GPT-4o mini TTS 测量;所有系统均测量并剔除了网络延迟。Eleven v4 Turbo 通过 WebSocket 流式传输。

来源:ElevenLabs Blog · elevenlabs.io