Google 发布 MedGemma 1.5 4B 与医疗语音模型 MedASR
Google 通过 HAI-DEF 项目发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并保留 2D 图像与文本能力。
推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开源入口,可据此判断医疗多模态模型的可用边界。
技术方向
AI 语音与音频的进展:语音合成、实时对话、音乐生成与音频理解的模型与产品。
36 条精选近 30 天 4 条共收录 88 条
Google 通过 HAI-DEF 项目发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并保留 2D 图像与文本能力。
推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开源入口,可据此判断医疗多模态模型的可用边界。
Google DeepMind 发布升级版 Gemini 2.5 Flash Native Audio,面向实时语音智能体,提升了复杂工作流处理、指令遵循和自然对话能力。
推荐理由:官方给出 Gemini 2.5 Flash Native Audio 在函数调用、指令遵循和多轮对话上的具体提升数据,可据此判断语音智能体的可用性变化。
Google Research 介绍了一种端到端语音到语音翻译(S2ST)模型,直接生成译文音频并保留原说话人音色,延迟仅 2 秒,而现有级联系统通常有 4-5 秒延迟且会累积误差。
推荐理由:Google 端到端语音翻译把延迟从 4-5 秒压到 2 秒并保留原说话人音色,可对照级联方案理解取舍。
OpenAI 发布更先进的语音到语音模型 gpt-realtime,并同步更新 Realtime API。新 API 能力包括 MCP server 支持、图像输入和 SIP 电话呼叫支持。
推荐理由:OpenAI 发布新一代语音到语音模型并扩展 Realtime API,读者可了解语音智能体在电话与工具调用上的新能力。
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 官方一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑能力,可据此判断其产品线的功能覆盖方向。
Mistral 发布 Voxtral 语音理解模型,提供 24B 生产版和 3B 本地与端侧版,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转写或 40 分钟理解,具备音频问答、摘要、多语言自动检测和语音直接触发函数调用能力,并保留 Mistral Small 3.1 的文本能力。
推荐理由:Mistral 开源两款语音理解模型,给出 32k 上下文、多语言与函数调用能力及低于同类 API 一半的价格,可据此判断开源语音方案的可用边界。
OpenAI 在 API 中推出新一代音频模型,开发者首次可以指示文本转语音模型以特定方式说话,例如“像一位有同理心的客服人员那样说话”,为语音智能体带来新的定制能力。
推荐理由:OpenAI 在 API 中上线新一代音频模型,开发者可首次用自然语言指令控制语音表达方式。
Hugging Face 发布 FastRTC,一个用 Python 构建实时音频和视频 AI 应用的通信库,内置语音检测与轮次切换、Gradio WebRTC UI,并支持 WebSocket 和挂载到 FastAPI。
推荐理由:FastRTC 把 WebRTC 实时音视频通信封装成 Python 库,读者可据此判断实时语音应用的搭建门槛变化。
OpenAI 发布 o1 模型,并同步带来 Realtime API 改进和一种新的微调方法等面向开发者的更新。官方仅给出上述概要,未披露具体参数、价格或可用范围。
推荐理由:OpenAI 官方一次性公布 o1 模型与开发者工具更新,可据此了解其面向开发者的能力布局。
OpenAI 发布 Realtime API,开发者可将其接入应用,构建快速的语音到语音交互体验。
推荐理由:OpenAI 官方发布 Realtime API,开发者可据此判断语音到语音交互的接入方式。
OpenAI 发布 ChatGPT 与 Whisper 的 API,供开发者将对话与语音能力接入自有应用。
Hugging Face 博客介绍如何用投机解码将 Whisper 推理速度提升约 2 倍,且数学上保证输出与单独使用主模型完全一致。在 LibriSpeech 基准上,Whisper large-v2 的 73 个样本推理时间从 73 秒降至 33 秒,WER 保持 3.5%;荷兰语 VoxPopuli 上从 117 秒降至 62 秒,WER 保持 12.8%。
推荐理由:原文给出可复用的投机解码实现与基准数据,读者可据此在现有 Whisper 流程中获得约 2 倍加速。
OpenAI 宣布 ChatGPT 新增看、听、说能力,可处理图像与语音输入并语音回复。
OpenAI 发布 ChatGPT iOS 应用,可同步对话记录并支持语音输入,同时带来最新的模型改进。该应用由 OpenAI 官方推出,面向 iPhone 用户提供移动端使用入口。
推荐理由:OpenAI 官方发布 ChatGPT iOS 应用,读者可了解其对话同步与语音输入等基础能力。
Hugging Face 发布教程,介绍如何用 Transformers 在任意多语言 ASR 数据集上微调 Whisper,涵盖 Common Voice 数据准备、特征提取器与 tokenizer 配置、训练评估及 Gradio 演示的完整代码。
推荐理由:原文给出用 Transformers 微调 Whisper 的完整代码流程,并附 8 小时数据把 WER 从 63.5% 降到 32.0% 的实测结果。
OpenAI 宣布训练并开源神经网络 Whisper,称其在英文语音识别上接近人类水平的鲁棒性与准确率。
推荐理由:OpenAI 开源语音识别模型 Whisper,读者可据此了解其在英文语音识别上的鲁棒性与准确率定位。