跳到正文
Google Gemini Blog·· 20 天前精选AI 评分80

Google 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking 语音模型

Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking

AI 导读

Google 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款实时对话模型,分别面向规模化低成本场景与高复杂度多步推理任务。

推荐理由

官方给出两款语音模型的定位差异与多项语音智能体基准成绩,可据此判断实时语音 Agent 的能力边界。

正文 · AI 翻译

2026年9月15日

|

Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 是我们迄今为止最先进的实时对话模型。智能和并行推理方面的重大升级使它们更直观地协作,并可通过语音执行复杂任务。


Tom Ouyang

首席工程师

Malini Jaganathan

技术团队成员,代表 Gemini 音频团队


Text "Introducing Gemini 3.8 Live and 3.8 Live Extended Thinking" with the Gemini Spark, all on a light blue background

收听文章

[[duration]] 分钟

此内容由 Google AI 生成。生成式 AI 仍处于实验阶段

2026年9月17日更新

今天,我们推出两款新模型,在近实时推理方面取得进展,更有效地赋能语音代理,让与 AI 的对话感觉更直观、更智能。

  • Gemini 3.8 Live:专为规模和成本效率打造,将对话智能与流畅对话和视觉基础相结合。
  • Gemini 3.8 Live Extended Thinking:专为高复杂度任务打造,具有更高的智能和多步推理能力。

对于开发者和企业而言,这些模型提供了可靠、可用于生产的语音代理的构建模块。它们还使在 Gemini 应用、Google Workspace 和搜索中与 Gemini 交谈更加流畅和协作——帮助您仅用语音即可处理复杂任务。

体验更流畅、更智能的对话

Gemini 3.8 Live Extended Thinking 提供企业级任务完成能力和智能,在 Artificial Analysis 的语音到语音质量指数中夺得总体第一名(82.6),并在代理任务完成方面领先,在 τ-Voice 上达到 68.6%,在 Sierra 的 τ-Voice-banking 基准上达到 35.1%。它还提供强大的推理能力,在 Big Bench Audio 上得分 97.7%,同时与其他前沿模型相比保持极具竞争力的价格。

Gemini 3.8 Live 在用户中表现出高度偏好,在 Speech Agent Arena 中排名第二。除了这一表现外,它仍然极具成本效益——为开发者和企业提供了一个专为规模打造的能力强大且高效的模型。

a chart showing Artificial Analysis Speech to Speech Index

A chart showing Artificial Analysis agentic performance

A chart showing Sierra

A chart showing Artificial Analysis cost per hour of input audio

在 ServiceNow 的 EVA-Bench(一个评估语音代理的基准)上,我们的模型通过成功平衡准确性与对话质量,推动了复杂工作流的帕累托前沿。

注意:这是在 Gemini Enterprise Agent Platform 上的 Live API 上运行的。

A chart showing EVA Bench Experience to Task Completion

Gemini 3.8 Live 近实时处理视觉输入,通过上下文丰富对话以提供更有帮助的响应。它能在对话中自动检测并在 97 种支持的语言之间切换。它在继续对话的同时在后台执行工具和 API 调用,因此模型可以确认请求并在任务于后台完成时继续聊天。

对于需要更深入推理的任务,3.8 Live Extended Thinking 同时进行推理和说话。它为复杂工作流提供更高的智能,同时保持不间断的对话流——使用像“让我查一下……”这样的早期口头提示自然地确认提示,并通过实时进度叙述引导用户完成多步后台任务。

在 Google Workspace、搜索和 Gemini 应用中,我们的 Live 模型提供更直观、更协作的体验——尤其是在处理您最复杂的任务时。

赋能开发者和企业语音生态系统

通过使用 Gemini Live API,Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 等开发者平台使开发者能够轻松构建和部署高性能的语音驱动界面。这些平台在后台管理复杂的实时媒体流基础设施,让开发者能够完全专注于打造用户体验。

我们还与 Salesforce、Genspark 和 Lumeris 等公司合作,他们对 3.8 Live 和 3.8 Live Extended Thinking 感到兴奋,并强调了其令人印象深刻的延迟、流畅性和工具调用能力。

Salesforce quote

11Sight Quote

Equal AI Quote

ServiceNow quote

Genspark quote

Lenskart quote

Lumeris quote

Agora quote

Ambr AI quote

LiveKit Quote

Casuu quote

通过 SynthID 水印确保透明度

我们的 AI 产品生成的所有音频都使用 SynthID 加水印。这种不易察觉的水印直接嵌入音频输出中,确保 AI 生成的内容可被检测,以帮助防止错误信息传播。有关我们安全与责任方法的详细信息,请查看模型卡。

开始使用我们最新的 Gemini Audio 模型:

3.8 Live 从今天开始逐步推出:

3.8 Live Extended Thinking 从今天开始逐步推出:

在您的收件箱中获取 Google 的最新消息

订阅我们的新闻通讯,获取产品更新、活动信息、特别优惠等更多内容。

您的信息将按照 Google 隐私政策使用。您可以随时选择退出。

来源:Google Gemini Blog · blog.google