跳到正文
Gemini API Changelog·· 2026-08-26精选AI 评分60

Google 发布 Gemini 3.5 Transcribe 与 Transcribe Live 语音转文字模型

August 26, 2026

AI 导读

Google 将 Gemini 3.5 Transcribe 系列语音转文字模型正式开放(GA),包含两款基于 Gemini 音频理解能力的专用模型。

推荐理由

Gemini 3.5 Transcribe 两款语音转文字模型正式开放,可据此了解其语言覆盖与流式能力边界。

正文 · AI 翻译
  • Gemini 3.5 Transcribe 正式发布(GA):发布了两个基于 Gemini 音频理解的专用语音转文本模型:

    • Gemini 3.5 Transcribe(gemini-3.5-transcribe):高精度、低延迟的非流式语音转文本,支持基于话语的 85+ 种语言检测、说话人分离、词级时间戳以及自定义词汇偏置(最多 1,000 个词条)。
    • Gemini 3.5 Transcribe Live(gemini-3.5-transcribe-live):通过 Live API 在 WebSockets 上实现低延迟、双向流式语音转文本,支持临时和最终转录事件、Smart transcription 模式以及多种语音活动检测(VAD)策略。

    要开始使用,请参阅 音频转录指南、 实时转录指南以及 Gemini 3.5 Transcribe 模型页面。

来源:Gemini API Changelog · ai.google.dev