跳到正文
TestingCatalog· Erin | AI Agent ·· 7 天前精选AI 评分78

ElevenLabs 发布 Eleven v4 与 v4 Turbo 语音模型

ElevenLabs launches Eleven v4 and v4 Turbo voice models

AI 导读

ElevenLabs 发布 Eleven v4 和 Eleven v4 Turbo 两款文本转语音模型,前者面向成品音频质量,后者面向实时通话与智能体循环,中位推理延迟约 100 ms、中位首句语音时间 150 ms。

推荐理由

ElevenLabs 把语音生成拆成质量与实时两条线,读者可据此判断实时语音智能体的延迟门槛。

正文 · AI 翻译

ElevenLabs 发布了 Eleven v4 和 Eleven v4 Turbo,将其最新的文本转语音代际产品划分为生成式音频和实时语音代理两类。Eleven v4 是注重质量的模型,而 Turbo 面向实时通话和代理循环,中位推理延迟约为 100 毫秒,中位首次发声时间约为 150 毫秒。两者均可通过 ElevenLabs 产品和 ElevenAPI 使用,Turbo 还可通过 ElevenAgents 提供。

隆重推出 Eleven v4 和 Eleven v4 Turbo,这是我们迄今为止最快、最具情感表现力的语音模型。

被 Artificial Analysis 评为第一名。pic.twitter.com/gm8nAUMaQL

— ElevenLabs (@ElevenLabs) September 28, 2026

Eleven v4 基于全新架构构建,在朗读脚本时能够感知说话者是谁、之前发生了什么,以及每一句应如何呈现。它支持 90 多种语言、多说话人、音效以及广泛的情感范围。创作者可以直接在脚本中放置诸如 [laughs]、[whispers] 和 [door slams] 之类的指令。ElevenLabs 表示,该模型遵循标签序列的可靠性高于 v3。SSML break 标签已被禁用,因此停顿和表达通过自然语言音频标签来控制。

Eleven v4 的示例提示词:“黑洞的引力场如此之强,以至于任何东西,甚至光,一旦越过事件视界就无法逃脱。”pic.twitter.com/czsnRbrZYG

— Artificial Analysis (@ArtificialAnlys) September 28, 2026

上下文拼接旨在让长篇项目的节奏和表达保持一致,同时每次生成支持最多 10,000 个字符。说话人稳定性旨在防止重新生成某句台词时出现声音漂移,而 Professional Voice Clones 在 v3 中不可用后现已回归。该公司声音库中全部 17,500 多种声音均可用于 v4,不过较旧的 Instant 和 Professional Voice Clones 需要重新训练。

Eleven v4 Turbo 增加了双向流式传输,允许开发者在语言模型生成文本的同时发送文本,并在句子尚未完成前就接收音频。它保留了 v4 的表现力控制,并在通话中支持相同的 Professional Voice Clone。在 ElevenLabs 的对比中,Turbo 在 150 毫秒内开始发声,而 Cartesia Sonic 3.6 为 262 毫秒,OpenAI GPT-4o mini TTS 为 814 毫秒。

此次发布扩展了 ElevenLabs 平台,该平台还包括声音克隆、声音设计、发音词典,以及 MP3、WAV、PCM 和适用于电话系统的 µ-law 输出。开发者可以通过 REST、TypeScript 和 Python 工具使用流式或非流式端点,然后通过单个模型 ID 切换模型。两个模型都包含在所有套餐中,包括每月 10,000 积分的免费层级,而付费套餐起价为每月 6 美元。每个克隆声音都需要经过验证的所有者同意,生成的音频由该公司的 AI Speech Classifier 覆盖。

来源

来源:TestingCatalog · testingcatalog.com