Google 发布 Gemini 3.8 Live 与 Extended Thinking 语音模型
Google rolled out Gemini 3.8 Live and Extended Thinking
Google 推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking 两款语音模型,由 Gemini Audio Team 开发,支持近实时对话与并行推理。
两款语音模型分别面向高并发对话与多步任务,并给出第三方基准排名和 Gemini API 等落地入口。
Google 正在推出 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,这两款语音模型专为近乎实时的对话和任务执行而打造。二者均由 Gemini Audio 团队开发,都将语音对话与并行推理相结合。Gemini 3.8 Live 面向高并发工作负载,兼顾成本效率、视觉接地和流畅对话,而 Extended Thinking 则处理复杂的多步骤工作。
隆重推出我们迄今为止最先进的 Gemini Audio 模型 🗣
Gemini 3.8 Live 和 3.8 Live Extended Thinking 让你能够无缝地说话、协作和执行任务,这意味着与 AI 对话变得自然多了。
那么,这两款模型有什么区别呢?让我们…… pic.twitter.com/Dfy7j4zxOh
— Google AI (@GoogleAI) September 15, 2026
Extended Thinking 以 82.6 分领跑 Artificial Analysis 的语音到语音质量指数。它在 tau-Voice 上得分 68.6%,在 Sierra 的 tau-Voice-banking 基准上得分 35.1%,在 Big Bench Audio 上得分 97.7%。Gemini 3.8 Live 在 Speech Agent Arena 中排名第二。在 ServiceNow 的 EVA-Bench 上,这些模型在 Gemini Enterprise Agent Platform 上通过平衡准确性与对话质量,推动了复杂工作流的帕累托前沿。

Gemini 3.8 Live 近乎实时地处理视觉上下文,可在 97 种支持的语言之间自动切换,并在持续说话的同时在后台运行工具或 API 调用。Google 的演示展示了它根据屏幕上的上下文引导员工入职,以及通过摄像头画面下棋。Extended Thinking 同时进行推理和说话,在较长的任务中使用诸如“让我查一下……”之类的提示语和进度更新。演示包括将手绘线框图和口头反馈转化为 React 组件、通过异步调用协调餐厅预订,以及通过语音制定商业计划。
Google 正在将这些模型推广到 Workspace 和 Search。Docs Live、Gmail Live 和 Keep Live 支持语音主导的导航和起草,而 Search Live 可以通过手机摄像头指导故障排除。Agora、Fishjam、LangChain、LiveKit、Pipecat、Vercel 和 Vision Agents 使用 Gemini Live API,Salesforce、Genspark 和 Lumeris 也与 Google 围绕这些模型展开合作。
这两款模型开始通过 Gemini API 和 Google AI Studio 向开发者推出。Gemini 3.8 Live 在 Gemini Enterprise 中处于私密预览阶段,即将登陆 Gemini Enterprise for Customer Experience,并在 Search Live 中向所有人开放。Extended Thinking 也处于企业私密预览阶段,即将面向 Customer Experience 和 Workspace 商业客户推出,并在 Gemini Live 中向所有人开放。Google AI Pro 和 Ultra 订阅者可以在 Docs 中使用它,而所有 Google AI 订阅者都可以在 Gmail 和 Keep 中访问它。Google 表示,其 AI 产品生成的所有音频都带有不可感知的 SynthID 水印,并且已发布了一份涵盖安全与责任的模型卡。
来源:TestingCatalog · testingcatalog.com