SchoolAI 用 GPT-4.1 打造教师主导的 AI 教学平台
SchoolAI 基于 GPT-4.1、图像生成和 TTS 构建安全、教师引导的 AI 教学工具,已服务超 100 万个课堂,提升参与度、监督与个性化学习。
SchoolAI 基于 GPT-4.1、图像生成和 TTS 构建安全、教师引导的 AI 教学工具,已服务超 100 万个课堂,提升参与度、监督与个性化学习。
OpenAI 发布更先进的语音到语音模型 gpt-realtime,并同步更新 Realtime API。新 API 能力包括 MCP server 支持、图像输入和 SIP 电话呼叫支持。
推荐理由:OpenAI 发布新一代语音到语音模型并扩展 Realtime API,读者可了解语音智能体在电话与工具调用上的新能力。
Mistral 为 Le Chat 上线一批新功能,包括预览版 Deep Research 模式、由新语音模型 Voxtral 驱动的语音模式、由推理模型 Magistral 支持的多语言推理、用于整理对话的 Projects,以及与 Black Forest Labs 合作的高级图像编辑。
推荐理由:Mistral 官方一次性为 Le Chat 补齐深度研究、语音、推理与图像编辑能力,可据此判断其产品线的功能覆盖方向。
Mistral 发布 Voxtral 语音理解模型,提供 24B 生产版和 3B 本地与端侧版,均以 Apache 2.0 许可开源并上线 API。模型支持 32k token 上下文,可处理最长 30 分钟转写或 40 分钟理解,具备音频问答、摘要、多语言自动检测和语音直接触发函数调用能力,并保留 Mistral Small 3.1 的文本能力。
推荐理由:Mistral 开源两款语音理解模型,给出 32k 上下文、多语言与函数调用能力及低于同类 API 一半的价格,可据此判断开源语音方案的可用边界。
Genspark 借助 GPT-4.1 和 OpenAI Realtime API 打造无代码个人智能体,45 天内做到 3600 万美元 ARR。
Retell AI 基于 GPT-4o 和 GPT-4.1 打造无代码语音自动化平台,帮助企业上线自然、实时的语音智能体,无需脚本或等待接通即可自动处理客户对话。该平台可降低通话成本、提升 CSAT,正被用于改造呼叫中心。
Hugging Face 在 Inference Endpoints 上线新版 OpenAI Whisper 部署方案,基于 vLLM 实现,性能较此前版本最高提升 8 倍。
Speak 正借助 AI 实现语言学习个性化,其 CEO 兼联合创始人 Connor Zwick 在对话中介绍了相关思路。
Hugging Face 与 Cloudflare 达成合作,让 FastRTC 开发者凭 Hugging Face token 即可接入 Cloudflare 覆盖 335 多个地点的全球 TURN 网络,构建低延迟实时语音与视频应用。
OpenAI 在 API 中推出新一代音频模型,开发者首次可以指示文本转语音模型以特定方式说话,例如“像一位有同理心的客服人员那样说话”,为语音智能体带来新的定制能力。
推荐理由:OpenAI 在 API 中上线新一代音频模型,开发者可首次用自然语言指令控制语音表达方式。
Hugging Face 发布 FastRTC,一个用 Python 构建实时音频和视频 AI 应用的通信库,内置语音检测与轮次切换、Gradio WebRTC UI,并支持 WebSocket 和挂载到 FastAPI。
推荐理由:FastRTC 把 WebRTC 实时音视频通信封装成 Python 库,读者可据此判断实时语音应用的搭建门槛变化。
Artificial Analysis 发布 Big Bench Audio,一个从 Big Bench Hard 改编的音频推理评测数据集,含 1000 道音频题,覆盖 Formal Fallacies、Navigate、Object Counting、Web of Lies 四类各 250 题。
OpenAI 发布 o1 模型,并同步带来 Realtime API 改进和一种新的微调方法等面向开发者的更新。官方仅给出上述概要,未披露具体参数、价格或可用范围。
推荐理由:OpenAI 官方一次性公布 o1 模型与开发者工具更新,可据此了解其面向开发者的能力布局。
Hugging Face 发布 Speech-to-Speech(S2S)级联流水线,串联 VAD、STT、语言模型与 TTS,支持英语、法语、西班牙语、中文、日语和韩语,可用单语言模式或 auto 标志自动检测语言。由于本地运行对算力要求高、易出现延迟,官方给出用自定义 Docker 镜像将其部署到 Hugging Face Inference Endpoints 的分步指南。
OpenAI 发布 Realtime API,开发者可将其接入应用,构建快速的语音到语音交互体验。
推荐理由:OpenAI 官方发布 Realtime API,开发者可据此判断语音到语音交互的接入方式。
OpenAI 提出 Consistency Models,可在不依赖迭代采样的情况下生成图像、音频和视频,从而解决扩散模型生成速度慢的问题。扩散模型虽推动了图像、音频和视频生成领域的发展,但其迭代采样过程导致生成缓慢。
OpenAI 发文详解其文本转语音模型 Voice Engine 的技术原理,并介绍相关安全研究。
OpenAI 与业内顶尖选角及导演专业人士合作,从 400 多份投稿中筛选,最终为 ChatGPT 选定 5 种声音。
Hugging Face 发布自定义推理 handler 方案,在 Inference Endpoints 上把 Whisper 语音识别、Pyannote 说话人分离与推测解码整合进单一 API。
OpenAI 发布 ChatGPT 与 Whisper 的 API,供开发者将对话与语音能力接入自有应用。
OpenAI 分享了 Voice Engine 小规模预览的经验教训,该模型可用于创建自定义语音。
Hugging Face 发布 TTS Arena,借鉴 LMSys 的 Chatbot Arena,让用户输入文本后听两个模型朗读并投票选出更自然的一个,投票前不显示模型名称。
Hugging Face 发布 AI 水印入门指南,介绍在内容生成时嵌入水印与生成后添加水印两种主要方法,前者需访问模型但更稳健,后者可适用于闭源模型。文章还梳理了 Glaze、Photoguard、Nightshade、Fawkes 等图像防护工具,以及 Truepic 基于 C2PA 标准的内容签名方案,并讨论了水印开放与闭源的利弊。
Hugging Face 博客介绍如何用投机解码将 Whisper 推理速度提升约 2 倍,且数学上保证输出与单独使用主模型完全一致。在 LibriSpeech 基准上,Whisper large-v2 的 73 个样本推理时间从 73 秒降至 33 秒,WER 保持 3.5%;荷兰语 VoxPopuli 上从 117 秒降至 62 秒,WER 保持 12.8%。
推荐理由:原文给出可复用的投机解码实现与基准数据,读者可据此在现有 Whisper 流程中获得约 2 倍加速。
OpenAI 宣布 ChatGPT 新增看、听、说能力,可处理图像与语音输入并语音回复。
Hugging Face 发布实战教程,演示如何用 Transformers、Optimum 和 Accelerate 三个库优化 Suno AI 的文本转语音模型 Bark。教程以 suno/bark-small 为例,基准测试显示未优化时单次生成耗时 9.38 秒、峰值显存占用 1.91 GB,并介绍了三种优化手段及其对比结果。
Hugging Face 发布教程,介绍如何基于 Meta AI 的 MMS 检查点微调 Adapter 层实现低资源语音识别。MMS 预训练检查点覆盖 1400 多种语言、参数量 300M 到 1B,每个 Adapter 层仅约 2.5M 权重,微调 10-20 分钟即可获得极低词错误率。低资源语言推荐用 Adapter 训练替代全模型微调,更省内存且性能更好。
Hugging Face 发布教程,讲解如何借助 Hugging Face Unity API 在 Unity 游戏中实现语音识别,可用于下达指令、与 NPC 对话或提升无障碍体验。教程从创建含开始/停止按钮和 TextMeshPro 文本框的场景入手,用 Microphone.Start() 以 44100 Hz 录制最长 10 秒音频,再编码为 WAV 格式发送给 API 转成文本。
OpenAI 发布 ChatGPT iOS 应用,可同步对话记录并支持语音输入,同时带来最新的模型改进。该应用由 OpenAI 官方推出,面向 iPhone 用户提供移动端使用入口。
推荐理由:OpenAI 官方发布 ChatGPT iOS 应用,读者可了解其对话同步与语音输入等基础能力。
Hugging Face 发布音频数据集使用指南,介绍如何通过 🤗 Datasets 的 load_dataset 函数一行代码下载并准备音频数据。目前 Hub 上已有 77 个语音识别数据集和 28 个音频分类数据集,并支持 Dataset Preview 在线试听样本。以 GigaSpeech 为例,其提供从 xs(10 小时)到 xl(10,000 小时)五种规模配置。
Hugging Face 发布教程,介绍如何用 Transformers 在任意多语言 ASR 数据集上微调 Whisper,涵盖 Common Voice 数据准备、特征提取器与 tokenizer 配置、训练评估及 Gradio 演示的完整代码。
推荐理由:原文给出用 Transformers 微调 Whisper 的完整代码流程,并附 8 小时数据把 WER 从 63.5% 降到 32.0% 的实测结果。
OpenAI 宣布训练并开源神经网络 Whisper,称其在英文语音识别上接近人类水平的鲁棒性与准确率。
推荐理由:OpenAI 开源语音识别模型 Whisper,读者可据此了解其在英文语音识别上的鲁棒性与准确率定位。
Hugging Face 博客介绍了如何利用 Wav2Vec2 的 CTC 架构特性,在 🤗 Transformers 中对任意长音频文件乃至实时语音进行高质量自动语音识别。
🤗 Transformers 现已集成 Kensho Technologies 的 pyctcdecode 库,可将 n-gram 语言模型与微调后的 Wav2Vec2 检查点结合用于语音识别解码。
Hugging Face 发布教程,演示如何用 🤗 Transformers 将预训练模型 Wav2Vec2-XLS-R-300M 微调用于低资源语音识别。教程以 Common Voice 土耳其语数据集为例,仅用约 4 小时验证训练数据,采用 CTC 算法微调,并用 WER 指标评估。
Hugging Face 发布教程,演示如何用 🤗 Transformers 微调 Wav2Vec2 预训练模型完成英语 ASR。Wav2Vec2 于 2020 年 9 月发布,基于超 5 万小时无标注语音预训练,仅用 10 分钟标注数据即可在 LibriSpeech 干净测试集上取得低于 5% 的 WER。