跳到正文
Google Gemini Blog·· 12 天前精选AI 评分71

Google 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

Gemini 3.8 text-to-speech says hello

AI 导读

Google 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款语音生成模型,前者面向角色设计与逐行表演指导,后者面向高吞吐、低成本的配音与语音智能体场景。

推荐理由

官方给出两款 TTS 模型的语音设计、逐行导演能力与基准排名,可据此判断语音生成从预设音色转向可定制创作的变化。

正文 · AI 翻译

2026年9月23日

|

Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 是我们迄今为止最具表现力的音频生成模型。在 Google AI Studio、Gemini API、Gemini Enterprise、Gemini Notebook 和 Google Vids 中生成自定义角色语音并指导场景对话。


Leland Rechis

集团产品经理

Alan Cowen

研究科学总监,代表 Gemini 音频团队


a text card image reading "Introducing Gemini 3.8 Flash TTS and 3.8 Flash-Lite TTS"

今天,我们为 Gemini 家族引入两款全新的文本转语音模型,将语音生成从静态预设转变为动态创意工作室。这些模型让创作者、开发者和企业能够打造更丰富、更具表现力的音频体验,同时为 Gemini Notebook 和 Google Vids 等产品带来更出色的用户体验。

  • Gemini 3.8 Flash TTS:专为深度创意指导和角色设计而打造。使用自然语言提示从零开始创造全新语音,让角色在游戏、沉浸式有声书、播客和互动媒体中栩栩如生。逐行指导每一句表演,对表演提示、节奏、口音转换和附和语进行精细控制。
  • Gemini 3.8 Flash-Lite TTS:专为大批量、高性价比的规模化应用而打造。针对大批量配音、音频内容创作和富有表现力的语音代理进行了优化,可对语调、节奏和表现力细节进行精细控制。

这些模型补充了我们快速发展的 Gemini 音频家族,此前已推出 3.5 Live Translate、3.5 Transcribe、3.8 Live 和 3.8 Live Extended Thinking。

创建并自定义你自己的语音

从 30 种原创语音扩展到无限语音库。无论你需要一个完全原创的角色语音,还是一个风格一致的品牌代言人,我们的 3.8 Flash TTS 模型都能驱动一个完整的语音工作室。这让你能够为每个时刻创建并使用富有表现力、听起来自然的语音,同时赋能开发者和企业轻松构建自定义音频体验。

  • 生成式语音设计:借助 Gemini 3.8 Flash TTS,通过自然语言提示在 100 多种语言和方言中自定义角色、口音和语音特征,从零开始打造专属语音——无论你是要让一只戏剧性的喷火龙活灵活现,还是打造一位带有独特地域韵律的魅力旁白。
  • 庞大的语音库:访问 2,000 多种可直接用于生产的语音,覆盖广泛的语言——包括墨西哥西班牙语、魁北克法语和苏格兰英语等地区变体。
  • 语音复刻:仅需 30 秒的音频样本,即可根据你的声音或你拥有使用权利的声音重建一致的语音特征,并内置同意验证、SynthID 水印和 C2PA 凭证,以保护开发者和他们的配音人才。
  • 保存与扩展:保存并管理你设计的自定义语音,确保在持续进行的项目中保持一致的表演效果并将偏差降至最低。
  • 语音混音:即将推出,从我们的语音库中选择一个语音,并微调音色、音高、节奏和口音。使用提示来调整特征(例如“添加微妙的美国南方口音”或“让表达更柔和”)。

逐行指导表演

选定语音后,两款 TTS 模型都能让你精确控制每一句台词的表达方式。

  • 逐行直接表演:编写你自己的舞台指示,或让 Gemini 通过自然的脚本提示来引导表达——从冷静的客服人员到低语的悬疑场景。
  • 长篇生成:在数小时的连续音频中保持高语音质量、自然的节奏和角色音色,并将说话人漂移降至最低——非常适合播客和有声书。
  • 原生双说话人场景编排:从单一脚本无缝指导多轮对话——无论是播客还是戏剧化叙事——同时保持两个声音清晰分离,并具有自然的对话轮替。
  • 脚本化的人声爆发与附和:使用非语言提示(如 <laughs>、<sigh>、<gasp>)和积极倾听的插话(如 |mhm| 或 |yeah|)添加逼真的对话质感,以实现精准的喜剧节奏和反应节拍。

获取为全球规模打造的表现力丰富的高质量语音生成

Gemini 3.8 Flash TTS 提供领先的语音定制能力,在 Hume AI 的 Voice Design Benchmark 中夺得综合第一(71.4),并在口音建模方面同样领先(60.8)。

Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 在不牺牲可靠性的前提下实现真正富有表现力的表演,并分别在 Hume AI 的 Overall Quality Index 中夺得第一和第二名。与 Gemini 3.1 Flash TTS 相比,该模型在长篇内容和双说话人剧本控制等广泛用例上展现出重大改进。

在 Voice Arena 的盲测人类偏好评估中,Gemini 3.8 Flash 和 Flash-Lite TTS 在日语、巴西葡萄牙语、越南语、现代标准阿拉伯语(MSA)、墨西哥西班牙语和印地语等关键全球语言中位居竞争者前列。这些模型支持超过 100 种语言,赋能创作者、开发者和企业构建面向全球的高质量多语言语音体验。

An evaluation showing text-to-speech quality benchmark Hume AI

an evaluation chart showing text to speech voice design leaderboard Hume AI

an evaluation chart showing text to speech leaderboard for Voice Arena

以信任、同意和透明为基础构建

我们在构建语音创建和复制能力时采用了严格的保障措施,以帮助保护配音人才、尊重身份并确保内容透明。对于语音复制,我们的系统利用同意验证:用户必须提供来自声音所有者的口头同意录音,且与参考说话人匹配,然后才能创建语音。

更广泛地说,我们的 Gemini Audio 模型生成的每个音频片段都使用 SynthID 加水印。这种不可感知的水印直接编织到音频输出中,确保 AI 生成的语音保持可检测,以帮助防止虚假信息。有关我们安全和责任方法的更多详细信息,请查看模型卡。

试用我们全新的 Google AI Studio 音频游乐场

从今天开始,开发者可以在 Google AI Studio 中体验这些全新的语音生成能力。它构建得像一个语音设计工作区,你可以从头提示全新的声音身份,或复制你自己的声音 1 ,然后将它们直接带入双说话人剧本编辑器,逐行指导表达。

在 Google AI Studio 中试用语音复制。

轻松部署高性能语音界面

通过使用 Gemini API,Agora、LiveKit、Pipecat、Vercel 等开发者平台使开发者能够轻松构建和部署高性能语音生成体验。

我们正与 Figma、HeyGen、Linguana、Wondercraft、99.co 和 Ollang 等公司合作,他们正在集成我们最新的 TTS 模型,以帮助加速全球配音、以细腻的地区口音本地化媒体内容,并大规模驱动对话式语音代理。

a quote from Darius Cheung, CEO and Co-Founder of 99 Group

a quote from Mason Adams, Developer Evangelist, Agora

a quote from Jonathan Gur-Zeev, Director of Product, Figma Weave

a quote from Bin Liu, VP of Engineering for Hygen

a quote card from Luke Pane, Developer, katsuyo

quote from Ritwik Baranwal, Associate Director AI/ML of kuku.

a quote from Oded Shafran, Co-Founder & CTO of linguana

Aziz Ulak, CTO & Co-founder, Ollang

a quote from Phil Marshall, Founder and CEO of Spoken

quote from Zina Rahman, Co-Founder and CEO, Transforms.AI

quote from Mei Ki Yiu, CTO of Wondercraft

开始使用我们最新的 Gemini Audio 模型:

Gemini 3.8 Flash TTS 从今天开始逐步推出:

Gemini 3.8 Flash-Lite TTS 从今天开始逐步推出:

在您的收件箱中获取 Google 的最新消息

订阅我们的新闻通讯,获取产品更新、活动信息、特别优惠等更多内容。

您的信息将按照 Google 的隐私政策 使用。您可以随时选择退出。

来源:Google Gemini Blog · blog.google