跳到正文
Google Gemini Blog·· 11 天前精选AI 评分71

Google 发布 Gemini 3.8 Live with Live Avatar

Introducing Gemini 3.8 Live with Live Avatar

AI 导读

Google 发布 Gemini 3.8 Live with Live Avatar,将实时视频生成与语音对话结合,为 Gemini 的实时对话模型带来近实时的视觉形象。

推荐理由

官方给出 Live Avatar 的实时音视频对话能力、异步工具调用与 97 种语言支持,可据此判断企业级数字人交互的落地边界。

正文 · AI 翻译

2026年9月24日

|

Gemini 3.8 Live 搭配 Live Avatar,为 Gemini 的对话式 AI 带来实时视觉呈现。通过将我们的实时对话能力与低延迟流式视频原生耦合,Live Avatar 为企业及其用户带来更自然、更直观的对话体验。


Shuo-yiin Chang

研究科学家

CJ Zheng

软件工程师,代表 Gemini Audio 团队


an image with the phrase "Gemini 3.8 Live with Live Avatar"

继上周 Gemini 3.8 Live 发布后的强劲势头,今天我们很高兴推出 Gemini 3.8 Live 搭配 Live Avatar——为我们的原生实时对话模型带来近乎实时的视觉呈现。通过将近乎实时的视频生成与语音相结合,Live Avatar 功能打造出一种能够聆听、观看并以动态视觉形象说话的体验。

凭借精准的唇形同步、自然的表情和流畅的轮流对话,Live Avatar 使企业能够以更具互动性的方式扩展其虚拟服务。无论是提供引人入胜的客户服务,还是交付互动式导览,它都能将数字交流转化为更丰富、更易获取的体验。

从今天起,Gemini 3.8 Live 搭配 Live Avatar 已在 Gemini Enterprise 中提供。

了解 Gemini 3.8 Live 搭配 Live Avatar 如何支持各种各样的角色,每个角色都有独特的外貌、声音和富有表现力的形象。

更自然、更多模态的对话

对话本质上是多模态的:我们通过聆听、观看、说话以及使用面部表情来进行交流。Live Avatar 将这些能力带给企业智能体。通过同时处理视觉和音频输入,它生成丰富的对话,带来更全面的体验。

观看 Gemini 3.8 Live 搭配 Live Avatar 如何近乎实时地接收它所看到和听到的内容,并以富有表现力的音频和视频作出回应,从而实现更自然的对话。

异步工具执行与持续在场

除了视觉呈现之外,该功能还由 Gemini 的高级推理能力提供支持。借助异步工具调用,Live Avatar 可以在继续活跃对话的同时,在后台触发工具调用并获取数据,处理复杂任务的同时确保对话流程不中断。

了解 Gemini 3.8 Live 搭配 Live Avatar 如何处理诸如酒店客人入住登记等复杂任务。在对话不间断进行的同时在后台调用工具。

为全球规模打造的对话体验

对话呈现应当感觉自然,而不应受语言限制。Live Avatar 具备原生多语言语音到语音同步功能。该功能可动态调整其唇形同步和表情,并能在 97 种语言之间无缝切换,而不会降低视频保真度或引入视觉漂移。

观看 Gemini 3.8 Live Avatar 如何在对话中途切换语言,唇形同步和表情在 97 种语言之间无缝适配。

契合您品牌需求的 Live Avatar

组织通常需要独特的视觉形象来契合其品牌。除了多样化的预设虚拟形象库之外,组织还可以自定义其 Live Avatar。开发者可以从一张高质量的参考图像生成一个完全动画化、可响应的虚拟形象,同时保留参考相似度、品牌风格或角色身份。自定义虚拟形象创建目前仅通过企业白名单提供。

以信任和透明为核心

我们构建 Live Avatar 时采用了严格的防护措施,旨在尊重身份,并保持 AI 生成内容的透明度。我们 AI 产品生成的所有输出都带有 SynthID 水印。这种不可感知的水印直接编织到音频和视频输出中,有助于确保 AI 生成内容可被检测,从而帮助减少错误信息和错误归属。要了解我们在安全与负责任部署方面的全面方法,请阅读我们的模型卡。

开始使用 Gemini 3.8 Live with Live Avatar

Gemini 3.8 Live with Live Avatar 已在 Gemini Enterprise 中提供。请浏览 API 文档以开始使用。

来源:Google Gemini Blog · blog.google