ElevenLabs 发布 Eleven v4 音频标签清单与自定义写法
The Eleven v4 Audio Tags list: Try them, then write your own
ElevenLabs 官方发布 Eleven v4 的 Audio Tags 清单,覆盖情绪、音量与表达、节奏、拟人反应、口音角色和音效六类,标签以方括号自然语言写在脚本中控制逐句演绎。
ElevenLabs 官方给出 v4 音频标签的完整分类与自然语言写法,可直接迁移到自己的 TTS 脚本中。
Eleven v4 是一款突破性的文本转语音模型,能将文本转化为一场表演。音频标签让你能够以精细的控制力指导这场表演的情感输出。只需放置一个方括号内的自然语言提示,如 [whispers] 或 [excited],然后聆听 v4 如何改变表达方式与之匹配。
这份 ElevenLabs 音频标签列表涵盖了完整的 Eleven v4 情感范围中的每一种情感,以及用于表达方式、节奏、反应、口音和音效的标签。掌握基础之后,我们还会教你如何用平实的语言编写自己的标签。
摘要
- 音频标签是方括号内的自然语言信号,Eleven v4 将其解读为表演指令,改变其后词语的表达方式。
- Eleven v4 是 Artificial Analysis Speech Arena [2026年9月] 中排名第一的模型,音频标签让你能够逐行指导这场表演。
- Eleven v4 情感范围轮盘让你聆听不同情感,快速概览模型的能力。
- 标签并不局限于固定列表,这意味着你可以通过组合特质来编写自己的标签,例如 [whispering, fearful],或描述某句台词背后的情境或角色。
- 音频标签可通过 ElevenAPI 在 Eleven v4、Eleven v4 Turbo 和 Eleven v3 上使用。
什么是 ElevenLabs 音频标签?
音频标签是自然语言提示,你可以将其嵌入写作中,放在方括号内。Eleven v4 将其解读为表演标记,用作改变某些词语或短语表达方式的指令。你在 ElevenLabs 文本转语音应用中将其与脚本内联编写,然后看着我们的模型将它们生动呈现。
Eleven v4 是Artificial Analysis Speech Arena 中排名第一的 TTS 模型,听众在此投票选出最自然的文本转语音。1 音频标签让你能够精确指导每一行的表达方式,将表演推向更高境界。
以下是在脚本中使用音频标签的方法:
- 将标签放在它所影响的词语之前:当你写下“[shouts] I can’t believe you said that to me”时,整句话都会被喊出来。
- 情感会延续:当你添加一个标签时,它的情感会延续到整行,这意味着只有当你想让表达方式转变时才需要引入另一个标签。例如,“[proud] I’ve been cooking for over a decade. I know how to boil an egg. [startled] What’s that burning smell?”
- 组合标签以叠加指令:在一组方括号内用逗号分隔音频标签,如 [whispering, playful],为你的 TTS 表演增添细微变化。
- 将标签与标点搭配:虽然音频标签设定情绪和表达方式,但你可以通过脚本中的标点自然控制节奏。添加省略号、破折号或大写字母来塑造句子的韵律。
关于标签如何工作以及如何取代 SSML 的更深入解释,我们撰写了一份音频标签完整指南。
情感音频标签列表
Eleven v4 情感轮盘包含数十种情感,每种都由 v4 演绎,让你在编写任何一个标签之前就能听出差异。
点击下方任意情感即可在轮盘上试听,或直接调整句子和情感,聆听 Eleven v4 将情感音频标签生动呈现。
情感类别 | 情感音频标签 |
高能量 | |
激烈 | |
紧张 | |
低能量 | |
平静与沉思 |
虽然我们在这里展示了一些情感,但你可以使用自然语言来实现任何你想要的情感。在下面的示例中,我们使用了一系列上面未展示的音频标签,来展示你可以通过自然语言提示做到什么。
[紧张不安] 好的,酒吧问答的最后一个问题,我们并列第一。[感兴趣] “哪颗行星的卫星最多?”嗯。[自鸣得意] 简单。是土星,大家都知道。[困惑] 等等,Priya 为什么摇头?[厌恶] 木星?你想写木星?[慌乱] 我们只有十秒钟了,随便选一个,选一个![充满希望] [紧张] 好吧。土星。交上去。[长时间停顿] [胜利] 耶!土星!我们赢了![调皮] [稍作停顿] Priya,我想你欠我一杯酒。
0:00
这个样本由 Jonathan Livingston 生动呈现。
表达方式和音量音频标签列表
表达方式和音量标签控制一句话听起来有多响或多强烈,与你选择附加的情感无关。如果你希望 v4 遵循更具体的设想,那么叠加表达方式和情感标签以实现更精细的控制。
以下是一些示例:
- [低语] 别动,它就在你身后。
- [喊叫] 所有人立刻撤离大楼!
- [轻柔地] 你已经尽力了。
- [安静地] 我想他们已经走了。
- [低沉,威胁] 你真不该来这里。
让我们看看音量和表达方式控制的实际效果。
[压低声音] 第十八洞。一推夺冠,人群已经完全安静下来。[几乎听不见] 他现在正在瞄准。球在滚动……还在滚动……[洪亮] 进了!他做到了!冠军是他的,这个地方彻底沸腾了![难以置信] 我解说高尔夫二十年了,从未见过这样的场面。
0:00
上面的样本由 Rod 生动呈现。
节奏音频标签列表
节奏音频标签改变一句话的速度。加入它们来制造悬念或营造完美的喜剧时刻。当时机和话语本身一样重要时,你应该使用节奏标签。
作为额外提示,标点符号自然有助于文本转语音的表现,所以在这里加倍使用,以完全控制句子:
- [缓慢地] 获奖者是……
- [匆忙地] 抱歉,我迟到了,火车坏了,我一路跑来的。
- [停顿] 然后电话响了。
- [拖长] 不——会——吧。
[缓慢地] 十……九……八……七…… [急促地] 等等,等等,等等,暂停倒计时,有人把咖啡落在控制台上了! [干脆地] 你能把那东西拿出去吗? [长停顿] [拖长音] 好——吧,谢谢。已经移走了。 [兴奋地] 继续倒计时! [快速] 三……二……一…… 发射!
0:00
Adam 是让这个样本活起来的那个声音。
类人反应音频标签列表
反应标签能为你的句子添加笑声、倒吸一口气、哭泣、咳嗽和叹息等声音。这些真的能让你的文本活起来,让 TTS 音频样本听起来自然,就像一个人即兴说话,而不是照着稿子念。
以下是一些反应音频标签:
- [笑] 你真信了?
- [叹气] 好吧。我来洗碗。
- [倒吸一口气] 那是真钻石吗?
- [清嗓子] 如果大家能听我说一下。
- [哭泣] 我没想到你会回来。
Eleven v4 还会在情绪需要时加入细微的人性化细节。听听情绪轮盘,你会听到像“你——你回来了?”和“呃,这是真的?”这样的台词,其中 v4 自行加入了结巴或呻吟。
[清嗓子] 嗨,大家好。不认识我的人,我是伴郎。 [笑] 好吧,我是 Tom 临时能找到的唯一人选。 [叹气] Tom 第一次跟我说起 Adam 时,我想,他不可能真的存在。 [倒吸一口气] 抱歉,那是蛋糕吗?太大了。总之。 [开始哭泣] 我从没见过他这么开心。 [笑] 好了,我没事。我没事。敬 Tom 和 Adam!
0:00
想在你自己的作品中使用这个声音,请找 Jack John。
口音与角色音频标签列表
用 Eleven v4 构建带有不同口音或角色声音的丰富场景比以往更容易。只需几个音频标签,你就能把声音切换成新的角色,同时保留其底层特质。一个声音可以在一次生成中扮演整个演员阵容。
- [英国口音] 想喝杯茶吗?
- [法国口音] 欢迎来到我的小咖啡馆。
- [澳大利亚口音] 别担心,伙计,我们会解决的。
- [海盗嗓音] 升起船帆,把朗姆酒递过来。
让我们在三十秒内走访四个地方。首先是伦敦。 [英国口音] 小心站台间隙。天气不错。 [兴奋地] 接下来,都柏林! [爱尔兰口音] 今天天气真好,不是吗?当然,下点雨也伤不了人。 [急促地] 没时间了,没时间了,去悉尼! [澳大利亚口音] 你好啊!小心海鸥,它们会抢你的薯条。 [海盗嗓音] 啊,现在到了公海,旅程在此结束,宝藏在此开始!
0:00
Lauren 帮助让这个样本活了起来。
音效音频标签列表
音效音频标签将非语音事件直接引入你的生成内容。例如,如果你在构建叙事场景或电子游戏音轨,可以用这些来营造戏剧效果,而无需单独的音效轨道。话虽如此,如果你在寻找特定的音效,随时可以使用 AI 音效生成器。
- [雷声隆隆] 越来越近了。
- [脚步声] 有人正上楼来。
- [门吱呀作响] 你好?有人在家吗?
- [鼓掌] 谢谢,谢谢,你们太客气了。
[猫头鹰叫声] [紧张] 你听到了吗?[吞咽] 那只是只猫头鹰,对吧?[树枝折断声] [紧张] 好吧,猫头鹰不会那样做。[许多脚步声] [害怕] 有什么东西在帐篷周围走动。[拉链拉开] [惊吓] 等等,谁刚刚打开了帐篷?[狗叫声] [笑] 饼干!你差点把我吓死。[叹气] 好吧,你也可以睡在这里。
0:00
上面片段中的声音是 Siren。
用自然语言编写你自己的音频标签
我们上面展示的任何音频标签都是一个很好的起点。但 ElevenLabs TTS 的魔力在于,你可以用自然语言编写任何新的音频标签,为模型提供额外的上下文。
或者,如果没有一个单词标签能捕捉到你所追求的效果,那就写一个更全面的指示。
- 结合情绪和特质: [紧张,谨慎] 或 [低语,恐惧]
- 描述方式: [像体育解说员一样,语速加快]
- 描述情境: [跑上楼梯后气喘吁吁]
- 描述角色: [一个听遍一切的疲惫侦探]
- 描述转变: [从平静开始,然后失去耐心]
[低声而虔诚,像自然纪录片解说员] 这里,在办公室厨房的宁静中,一只罕见的生物出现了。[几乎抑制不住兴奋] 实习生。[缓慢而悬疑] 他走向最后一块生日蛋糕。他整个下午都在等待这一刻。[语速加快,像体育解说员] 他冲过去了,他伸手了,他快到了,他——[突然,极度失望] 会计部的人先到了。[低声而虔诚] 大自然,一如既往,是残酷的。
0:00
用 Spuds Oxley 让你的场景栩栩如生。
选择音频标签的技巧
用自然语言写作在制作文本转语音音频样本时为你提供了极大的灵活性,但也意味着要获得完美的输出可能需要反复尝试。
为了让你的 Eleven v4 TTS 体验尽可能顺畅,这里有一些使用音频标签的技巧:
- 先听再写: 在 情绪轮盘 上播放几种情绪,听听 v4 如何诠释每一种(或者用它来获取灵感),然后为你的台词选择最接近的匹配。
- 先换标签再重写台词: 如果某次演绎不理想,试试相邻的情绪,比如用 [失望] 代替 [绝望],然后重新生成。
- 每个分句使用一个标签: 在同一段文字上使用对比鲜明的标签可能会模糊表演效果。在你希望情绪改变的地方添加一个新标签。
- 给模型一个完整的场景: Eleven v4 在有上下文时表现更好。文本转语音应用每次生成最多支持 10,000 个字符的窗口,你有空间构建分层的指示,在你的场景中创造魔力。
- 从预设开始,然后具体化。 如果 [紧张] 接近但不完全对,写出缺少的部分:[紧张,试图听起来自信]。
但最重要的是,进入 ElevenLabs TTS 应用并尝试是让自己快速上手并开始制作高质量 TTS 音频的最佳方式。
在 Eleven v4 上开始使用沉浸式音频
没有确定的 ElevenLabs 音频标签列表,因为你可以通过自然语言编写创建任何你想要的组合。此列表中的每个标签都适用于 Eleven v4,你在编写场景时想到的标签也同样适用。
从 Voice Library 的 17,500 多种声音中挑选一个,粘贴你的脚本,并添加你的第一个 Audio Tag 即可开始。
了解有关 Eleven v4 的更多信息,或注册以打造令人印象深刻的音频表演。
关于 ElevenLabs Audio Tags 的常见问题
- Artificial Analysis,Provider Voice Arena Preference Elo,2026 年 9 月 30 日
来源:ElevenLabs Blog · elevenlabs.io