跳到正文
ElevenLabs Blog· Jack Limebear·· 9 天前精选AI 评分61

ElevenLabs 详解如何用 Eleven v4 的 Audio Tags 导演情感语音

Emotional Text to Speech: How to direct AI voice performances with Eleven v4

AI 导读

ElevenLabs 发布教程,介绍如何用 Eleven v4 的情感 TTS 通过 Audio Tags 逐句导演语音表演,例如 [furious]、[sarcastic]、[crying] 等标签会改变同一句话的语气与节奏。文中以同一句台词加五种不同标签演示效果差异,并给出实践建议:换标签而非改写文本、整段生成以提供场景上下文、每句只用一种情绪,TTS 应用单次生成上限为 10,000 字符。

推荐理由

官方给出用 Audio Tags 逐句导演语音情绪的具体写法与示例,可直接迁移到广告、有声书等脚本创作。

正文 · AI 翻译

情感文本转语音(TTS)将脚本转化为表演。情感 TTS 模型不是单调地朗读,而是带着情感说出每一个词,用愤怒、喜悦、悲伤、沮丧等情绪让场景鲜活起来。

通过将音频标签编织进脚本的结构中,你可以像导演一样塑造文本转语音的表演。添加 [furious] 来提升一句台词的强度,添加 [sarcastic] 来增添一丝冷幽默,或用任何其他标签来向模型展示你希望某句台词如何表演。 

借助 Eleven v4,你可以逐行指导情感 TTS。以下是如何构建脚本,让你的文字鲜活起来。

什么是情感文本转语音?

情感文本转语音是 AI 生成的语音,它是在表演一句台词,而不是朗读它。它表达情感,理解时机和节奏,用强调说出正确的词,并添加叹息和笑声等非语言声音。

Eleven v4 是一款突破性的模型,它将文本变成真正的表演。借助行内描述,同一句话可以根据你的设想被低语、喊叫或含泪说出。

无论你是在为下一次发布撰写广告活动,还是在让你的小说章节鲜活起来,Eleven v4 都会以 最高质量的文本转语音 支持你的旅程。

Eleven v4 如何解读情感指导

Eleven v4 从你脚本中的音频标签获取情感指导线索,并将其转化为自然的音频表演。

以下是几种你可以用 Eleven v4 为文本添加情感指导以增强最终输出的方法:

  • 音频标签: 将 音频标签 写入你的指令中,例如 [whispers] 或 [cries],以在脚本中放置行内指导。你将能够像指导任何舞台表演者一样指导 v4,从而创作出具有情感深度的场景。
  • 标点符号: 使用标点符号与音频标签一起塑造节奏和表达。省略号会放慢一句台词,破折号会在句子中间打断说话者,感叹号会增加强度,为你提供另一层指导而无需添加标签。
  • 情感连续性: 以某种情感开始一句话,Eleven v4 会将这种语气贯穿整行。在 v4 上使用音频标签迭代构建你的场景,创作出丰富、有上下文的脚本。

为了展示音频标签在 v4 中让文本鲜活起来的效果,让我们以带标签和不带标签的音频为例,探索它们之间的区别。

在第一个示例中,我们只使用一个默认句子。作为参考,这些示例中我们使用 Siren。

Eleven v4 上不带音频标签的故事段落

夜晚很安静,几乎不自然地安静。直到我听到身后的旧门吱呀一声打开。

我慢慢转过身,喊道:“有人吗?”

没有回答。

然后,从黑暗中的某个地方传来一声低沉、安静的笑声。

我后退了一步。“你真不该来这里,”一个声音低语道。

然后灯灭了。

0:00

现在,第二个示例是同一句话,但添加了音频标签。我们有情感提示、音效,甚至文本之外的声音,比如邪恶的笑声。

Eleven v4 上带音频标签的故事段落

[hesitant] 夜晚很安静,几乎不自然地安静。

[nervous] 然后我听到身后的旧门吱呀一声打开。[gate creaking] [scared] 我慢慢转过身,喊道:“有人吗?”

[tense, cautious] 没有回答。

[silence] [whispering, fearful] 然后,从黑暗中的某个地方,传来一声低沉、轻微的笑声。[evil laugh] [alarmed] 我后退了一步。[footstep] [low, threatening] “你真不该来这里。”一个声音低语道。

[whisper] [terrified] 然后,灯灭了。[light switch clicking]

0:00

五个情感文本转语音表演,使用Eleven v4

展示Eleven v4全部能力的最佳方式就是亲自尝试。通过创建账户,你可以在几分钟内开始使用Eleven v4。

为了给你一个小演示,展示这个情感文本转语音模型的可能性,这里有一句话被渲染了五次。每一行都分配了不同的舞台指示,精确展示了你可以用这个模型做什么。

以下五张卡片都使用“I didn’t think you’d actually come back.”作为文本,并配以情感丰富的音频标签进行修改。作为参考,这些示例还使用了Siren。

添加[furious]

辅音变硬,爆破音变得更加明显。这句话听起来愤怒,像是一种指责。

[furious]

[furious] I didn't think you'd actually come back

0:00

添加[excited]

音调升高,语速加快,同样的短语转变为愉快的欢迎。

[excited]

[excited] I didn't think you'd actually come back.

0:00

添加[sarcastic] 

音调变得平坦,单词的元音拉长。讽刺是音频标签的一个绝佳用法,因为说出的词语与语调中写出的词语直接矛盾。

[sarcastic]

[sarcastic] I didn't think you'd actually come back.

0:00

添加[crying]

这个让人泪目。表达变慢,并在句子中间断裂。你会注意到呼吸在这里起到了很大的作用。

[crying]

[crying] I didn't think you'd actually come back.

0:00

添加[worried]

更安静且略带犹豫,[worried]抽走了这句话中的确定性。

[worried] I didn't think you'd actually come back.

0:00

编写AI可以表演的脚本的技巧

我们让ElevenLabs文本转语音应用尽可能直观。进入页面后开始输入,或添加描述性的音频标签,将特定的声音或情感嵌入到你的场景中

以下是一些其他技巧,可以帮助你获得Eleven v4情感文本转语音的最佳效果:

  1. 迭代你的指示:如果某句话效果不理想,换一个标签而不是重写文本。试试用[worried]代替[sad],或用[sarcastic]代替[annoyed],然后重新生成,直到表达符合你的设想。
  2. 一次性生成完整场景:虽然单独句子可以带来细腻的表演(如我们上面所演示的),但Eleven v4在用于段落或文本片段时效果最好。给模型足够的文本以建立场景上下文,将有助于提升整段文本的表现。使用Eleven v4,你在TTS应用中每次生成最多可以写10,000个字符。
  3. 每个短语使用一种情感:虽然你可以在一个句子中叠加多个音频标签,但最好每个句子片段只使用一个,以避免混淆。添加相互矛盾的情感作为指示可能会导致输出不够准确。或者,在你想要的确切从句前添加一个标签,如果你想在句子中间改变情感,可以在该从句后添加一个新标签。 

有了这些技巧,你很快就能将文本转化为表演。

开始使用Eleven v4进行情感文本转语音

你在本文中看到的一切,都是在 ElevenLabs 文本转语音应用中,用一段脚本、一个声音和少量 Audio Tags 在 Eleven v4 上生成的。

要创建你自己的场景,只需选择一个声音,粘贴你写好的台词,然后导演你的第一场表演。

进一步了解 Eleven v4,或注册以开始使用并生成你的第一个作品。

关于情感文本转语音 AI 的常见问题

来源:ElevenLabs Blog · elevenlabs.io