跳到正文
  1. Google DeepMind74

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar

    Google DeepMind 发布 Gemini 3.8 Live with Live Avatar,在 Gemini 3.8 Live 基础上为原生实时对话模型加入近实时视觉形象,可同时处理视觉与音频输入并输出带表情和口型同步的音视频。

    推荐理由:官方给出 Live Avatar 的多模态对话、异步工具调用与 97 语言同步细节,可据此判断企业级实时数字人落地的能力边界。

  1. Google DeepMind72

    Google DeepMind 发布 Gemini 3.8 Flash TTS 与 Flash-Lite TTS

    Google DeepMind 发布 Gemini 3.8 Flash TTS 和 Gemini 3.8 Flash-Lite TTS 两款文本转语音模型,前者面向角色设计与逐行表演指导,后者面向高并发配音与语音智能体。

    推荐理由:官方给出两款 TTS 的定位差异、可用入口与基准排名,便于判断语音生成在创作与规模化场景中的分工。

  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.8 Live 与 3.8 Live Extended Thinking

    Google DeepMind 发布两款实时语音对话模型 Gemini 3.8 Live 与 Gemini 3.8 Live Extended Thinking,前者面向规模化与成本效率,后者面向高复杂度任务与多步推理。

    推荐理由:两款语音对话模型分别面向规模化与高复杂度任务,并给出语音智能体基准成绩与开发者接入渠道。

  1. OpenAI News67

    OpenAI 在 API 中上线 GPT-Live-1 语音模型

    OpenAI 在 API 中推出 GPT-Live-1,支持自然的全双工语音对话。该模型在指令遵循上更强,并支持自定义音色和电话(telephony)接入。

    推荐理由:OpenAI 把全双工语音对话能力开放到 API,开发者可据此评估语音应用的接入方式。

  1. Hugging Face Blog62

    Open ASR Leaderboard 新增首个全球南方语言评测集 Monsoon

    Voice Arena 与 Hugging Face 合作在 Open ASR Leaderboard 上新增 Monsoon en-IN 与 Monsoon hi-IN 两个评测集,印地语成为该榜单多语言标签页上的首个印度语言。

    推荐理由:Open ASR Leaderboard 首次纳入印地语与印度英语评测集,读者可了解多语言语音评测如何按说话人属性拆解误差。

  1. Google DeepMind71

    Google DeepMind 发布语音转文字模型 Gemini 3.5 Transcribe

    Google DeepMind 发布语音转文字模型 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可直接把原始音频转为准确、格式化文本。

    推荐理由:官方给出 WER、延迟与多语言数据,并说明实时与录音两条 API 的接入方式,便于开发者评估语音链路选型。

  1. Hugging Face Blog66

    Hugging Face 研究量化语音识别中的基准优化现象

    Hugging Face 发布研究,用共识分歧、掩蔽实体检索和拼写切换三项探针量化语音识别中的基准优化现象,评测了 11 个开源 ASR 模型。结果显示部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考转写中的错误,即使音频与之矛盾或相关词已被静音,在 LibriSpeech 上部分模型复现被静音数字的比例约为 30–40%。

    推荐理由:通过三项探针量化 ASR 模型的基准优化行为,并给出可复用的检测脚本与榜单入口。

  1. Google Research72

    Google 推出 AMIE (Video),实现实时视频临床问诊

    Google Research 发布 AMIE (Video),基于 Gemini 和 Project Astra 构建,可在实时视频问诊中感知非语言线索、引导虚拟体格检查并同步进行诊断推理。

    推荐理由:Google 把 AMIE 从文本诊断扩展到实时视频问诊,并给出随机对照的评测设计,可了解多模态临床 AI 的当前边界。

  1. Hugging Face Blog60

    NVIDIA 发布 Magpie TTS 多语言语音模型,新增阿拉伯语、韩语和巴西葡萄牙语

    NVIDIA 发布 Magpie TTS Multilingual,一个 364M 参数的开源权重语音合成模型,支持 12 种语言,本次新增现代标准阿拉伯语、韩语和巴西葡萄牙语,并通过更新训练数据提升了多种既有语言的质量。

    推荐理由:原文给出 364M 开源权重模型的多语言覆盖与各 GPU 上的 TTFA 实测数据,可据此评估自建语音链路的延迟预算。

  1. OpenAI News62

    OpenAI 发布新一代语音模型 GPT-Live

    OpenAI 发布新一代语音模型 GPT-Live,用于实现更自然的人机交互,目前已接入 ChatGPT Voice。

    推荐理由:OpenAI 发布新一代语音模型并接入 ChatGPT Voice,读者可据此了解语音交互能力的代际更新。

  1. Hugging Face Blog62

    Hugging Face 与 Cerebras 将 Gemma 4 引入实时语音 AI

    Hugging Face 与 Cerebras 联合演示了一套实时语音到语音的开源流水线,用 Cerebras 加速 Gemma 4 31B 的推理。该架构为模块化设计,依次经过 Nvidia Parakeet 语音识别、Cerebras 上的 Gemma 4 VLM 推理和阿里 Qwen3TTS 语音合成,各层均可替换。

    推荐理由:原文给出了一套可替换的实时语音到语音开源架构,读者可据此了解各层组件如何组合与复用。

  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3.5 Live Translate 实时语音翻译模型

    Google DeepMind 发布 Gemini 3.5 Live Translate,这是一款支持 70+ 语言的近实时语音到语音翻译音频模型,可自动检测语言并保留说话人的语调、节奏和音高。

    推荐理由:Google 发布支持 70+ 语言的实时语音翻译模型,并给出开发者、企业、消费端三条落地路径。

  1. Hugging Face Blog62

    Reachy Mini 实现全本地语音对话

    Hugging Face 发布教程,介绍如何让 Reachy Mini 完全本地运行语音对话,无需云端、API key,音频不出本机。

    推荐理由:Hugging Face 给出 Reachy Mini 全本地语音对话的完整级联方案与可替换组件清单,读者可据此复现并自行替换各环节模型。

  1. Google DeepMind62

    Google DeepMind 发布 AI co-clinician 医疗 AI 研究计划

    Google DeepMind 宣布 AI co-clinician 研究计划,探索 AI 智能体在医生临床监督下协助患者诊疗的“三方照护”模式。在 98 个真实初级保健查询的盲评中,该系统 97 例无关键错误,优于医生常用的两款 AI 系统;在 140 项问诊技能评估中,AI 在 68 项达到或超过初级保健医生水平,但专家医生在识别危险信号和指导关键体格检查上整体仍更强。

    推荐理由:DeepMind 公开医疗 AI 智能体的多模态评测细节,读者可据此了解 AI 在临床问诊中已达标与仍欠缺的具体环节。

  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash TTS 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash TTS,称其在可控性、表达力和语音质量上均有提升,并引入可用自然语言指令控制语气、语速和表达方式的音频标签。

    推荐理由:官方给出新语音模型的音频标签控制方式、Elo 分数与多语言覆盖,可据此判断表达力控制的实际粒度。

  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.1 Flash Live 语音模型

    Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,具备更高精度和更低延迟。该模型在 ComplexFuncBench Audio 上取得 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后取得 36.1%,并支持多语言。

    推荐理由:官方给出语音模型在函数调用与长程推理基准上的分数,并说明开发者、企业与普通用户三类入口的可用范围。

  1. Mistral AI71

    Mistral AI 发布 Voxtral TTS 语音合成模型

    Mistral AI 发布首款文本转语音模型 Voxtral TTS,4B 参数,支持英语、法语、德语、西班牙语、荷兰语、葡萄牙语、意大利语、印地语和阿拉伯语共 9 种语言,可做情感表达与零样本跨语言音色适配。

    推荐理由:Mistral 首款 TTS 模型给出 4B 参数、9 语言与 70ms 延迟等具体指标,并附与 ElevenLabs 的人工对比结果。

  1. Google Research62

    Google Research 发布 WAXAL:覆盖 27 种非洲语言的大规模开放语音数据集

    Google Research 发布 WAXAL 大规模开放语音数据集,覆盖 27 种撒哈拉以南非洲语言、超过 1 亿使用者,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音和超过 565 小时用于 TTS 的高保真录音,由非洲高校与社区组织主导采集,Google 提供方法指导。项目自 2021 年启动,Google 表示将持续扩充语言覆盖。

    推荐理由:Google Research 联合非洲高校发布 27 种语言的语音数据集,可了解低资源语言语音数据的采集方法与开放许可安排。

  1. Mistral AI71

    Mistral 发布 Voxtral Transcribe 2 语音转写模型家族

    Mistral 发布 Voxtral Transcribe 2,包含批量转写的 Voxtral Mini Transcribe V2 和面向实时场景的 Voxtral Realtime,支持说话人分离、上下文偏置和词级时间戳,覆盖 13 种语言。

    推荐理由:官方给出两款语音转写模型的延迟、错误率与每分钟价格,可据此判断实时语音场景的选型成本。

  1. Google Research66

    Google 发布 MedGemma 1.5 4B 与医疗语音模型 MedASR

    Google 通过 HAI-DEF 项目发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并保留 2D 图像与文本能力。

    推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开源入口,可据此判断医疗多模态模型的可用边界。