Google DeepMind 发布语音转文字模型 Gemini 3.5 Transcribe
Google DeepMind 发布语音转文字模型 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可直接把原始音频转为准确、格式化文本。
推荐理由:官方给出 WER、延迟与多语言数据,并说明实时与录音两条 API 的接入方式,便于开发者评估语音链路选型。
Google DeepMind 发布语音转文字模型 Gemini 3.5 Transcribe,称其为目前最精确的语音转文字模型,可直接把原始音频转为准确、格式化文本。
推荐理由:官方给出 WER、延迟与多语言数据,并说明实时与录音两条 API 的接入方式,便于开发者评估语音链路选型。
ChatGPT for Teachers 扩展至 55 个美国学校系统,为超过 10 万名教育工作者和员工提供安全的 AI 工具、培训与支持。
OpenAI 发布新报告,探讨学生与教育者如何使用 ChatGPT 让学习更具连续性,将支持延伸到课堂之外。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式后期交互检索,并配套完整训练方案。
推荐理由:原文给出多向量检索模型的完整微调配方与实测对比,读者可据此判断自己领域是否值得自训。
loveholidays 借助 OpenAI Codex 让公司各团队都能参与软件开发,把想法更快变成产品。该案例展示了 Codex 如何降低开发门槛,使非工程岗位也能动手构建。
OpenAI 公布 Hugging Face 安全事件的调查发现,并说明为加强 AI 模型安全、监控与对齐所采取的措施。原文仅提供摘要,未披露事件细节与具体措施内容。
Google 在 CHI 2026 发布研究原型 AgentHands,可将 LLM 的高层推理映射为 XR 头显中与语音同步的手势,让 AI 智能体在 3D 空间里指点、演示物体。系统包含环境感知、手势事件库与手势嵌入推理三步,支持指示、象形、表达三类手势。在 N=12 的用户研究中,AgentHands 相比纯语音基线在空间指代效果上有显著提升。
IBM Granite 团队发布 Granite 4.2,这是其首个稠密 decoder-only 推理模型家族,包含 3B、8B、30B 三个规模,基于 Granite-4.1 基座后训练而来,全部以 Apache 2.0 许可开源。
推荐理由:原文完整披露了 Granite 4.2 的预训练、SFT 数据配比与多阶段 RL 细节,可据此了解推理模型在智能体环境中的训练路径。
Multiverse Computing 提出 Quantization-Aware Healing(QAH),把 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,在 9 项基准中有 7 项超过该 60B 模型的 bfloat16 版本。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的修复配方,并附 9 项基准对比,可据此判断 4-bit 部署的精度取舍。
OpenAI CFO Sarah Friar 阐述了芯片、算力、模型与产品各层的进步如何叠加,从而以更大规模和更低成本交付更有用的智能。
OpenAI 公布自研推理芯片 Jalapeño 的首批结果,称其在 AI 推理上实现行业领先的速度与能效,为现代模型带来更高吞吐和更低延迟。该芯片为 OpenAI 定制,主打更快、更省电的推理表现。
OpenAI 封禁了一批俄罗斯来源账号,这些账号用 AI 推广一个虚构的以色列智库,以及一个称赞俄罗斯、批评西方的“主权”指数。材料未披露账号数量、处置时间等更多细节。
OpenAI 为 ChatGPT Work 和 Codex 推出 Admin 插件,用于分析工作区用量、管理成员与权限、调整额度并处理管理请求。
Hugging Face 在 Gradio 中内置 gr.Workflow,把多步 AI 流水线描述为带类型端口的节点图,Gradio 直接提供可拖拽画布,每个节点可运行、每个中间结果可见。
推荐理由:Gradio 把多步 AI 流水线做成可拖拽的图,并自动暴露 REST 接口,读者可据此判断现有 Python 脚本的改造方式。
Mistral 与 HUMAIN 宣布战略合作,覆盖 AI 基础设施、先进模型开发与 AI 解决方案部署,初期聚焦网络安全与语音,并计划开发阿拉伯语表现强劲的前沿模型。合作规模达数亿欧元,Mistral 将探索使用 HUMAIN 数据中心基础设施,双方还计划在沙特面向受监管行业制定联合市场策略。
GPT‑5.6 现已在 Kiro 中可用,帮助开发者完成软件的规划、构建、审查与测试,并带来更好的性价比。
Google Research 提出 Biomarker Discovery Framework,一个在人类监督下把候选生物标志物优先级排序组织为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。
Google DeepMind 宣布与游戏开发商合作,探索由 AI 驱动的新玩法体验,并回顾了从 DQN 玩 49 款 Atari 游戏到 AlphaGo、AlphaStar 的游戏 AI 研究历程。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名化移动性数据与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。
Papers with Code 采用混合搜索系统,用 PostgreSQL 全文检索加 pgvector 向量召回,并通过 RRF 融合两路结果。
Hugging Face 发布研究,用共识分歧、掩蔽实体检索和拼写切换三项探针量化语音识别中的基准优化现象,评测了 11 个开源 ASR 模型。结果显示部分高分模型会复现 VoxPopuli 和 LibriSpeech 参考转写中的错误,即使音频与之矛盾或相关词已被静音,在 LibriSpeech 上部分模型复现被静音数字的比例约为 30–40%。
推荐理由:通过三项探针量化 ASR 模型的基准优化行为,并给出可复用的检测脚本与榜单入口。
Liquid AI 为 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 发布 DSpark 草稿模型检查点,通过投机解码在不改变输出质量的前提下提升解码速度,GPU 上吞吐最高提升 3.18 倍,端侧最高 2.87 倍。
推荐理由:官方给出三个模型的草稿检查点与 H100、MacBook 实测吞吐,可据此判断投机解码在端侧与云端的落地差异。
微软研究院发布深度学习交换关联泛函 Skala 1.1,训练数据比首个公开版本多 2.5 倍,在 GMTKN55 上取得 2.8 kcal/mol 的加权平均误差,55 个类别中 32 项排名第一。Skala 现已在 CP2K 中可用,并正集成进 Psi4、FHI-aims、ORCA 和 VASP,同时推出持续追踪各版本计算性能的 living benchmark。
Mistral 发布 Agentic Search,作为让模型在复杂文档中导航、阅读并核验信息的检索层,通过 Mistral Search Toolkit 和 Studio、Vibe 中的 Libraries 提供。
推荐理由:原文给出多步检索循环在 FinanceBench 与 OfficeQA Pro 上的准确率、token 与延迟变化,可据此判断传统一次性 RAG 的边界。
OpenAI 推出新博客 Intelligence Age,探讨变革性 AI 将如何重塑权力、治理、经济与个人自由。
Stampli 借助 Codex 和 ChatGPT Work,在截止日期固定、设计资源被占用的情况下,把原本数周的发布物料制作压缩到数天,发布工时减少 68%。
OpenAI 重申为符合条件的 API 客户提供零数据保留(Zero Data Retention),并预览 Private Safety Processing,可在不牺牲数据隐私的前提下实现高级 AI 安全处理。
Replit 推出 Free Mode,由 GPT-5.6 Luna 驱动,让任何人都能把想法变成可运行的软件,无需担心 token 成本。
推荐理由:Replit 用 GPT-5.6 Luna 支撑免费模式,读者可据此判断无 token 成本顾虑的软件创建门槛变化。
ChatGPT Ads 扩展至 31 个欧洲市场,广告主可在用户探索、比较选项和做出决策的过程中触达他们。
OpenAI 发起一项计划,旨在加强国家安全领域对 AI 的民主监督,通过工具、培训和专业知识为政府机构提供支持。
Hugging Face 博客发布 ALTK-Evolve 研究,在 AppWorld 的 585 个多步任务上测试八款模型后发现,Agent 记忆不是开关而是需要按模型校准的剂量。
OpenAI 正在为前沿 AI 模型加强监控、对齐与安全防护,并称新的保障措施正在引导模型开发节奏。该说明未披露具体模型版本、参数规模或上线时间。
OpenAI 推出 ChatGPT for Teens,面向青少年学习与批判性思考场景,内置更强保护措施、健康使用功能和额外的家长控制选项。
OpenAI 与 CodeAI 达成合作,帮助学生建立 AI 素养、批判性思考 AI,并培养负责任地使用和塑造 AI 的技能。
Asana 借助 OpenAI Codex 在两周内替换了陈旧的测试系统,模型与基础设施成本约 1.2 万美元。这项原本预计耗时数年的代码迁移因此大幅提速。
NVIDIA 团队使用 ChatGPT Work 减少手动任务、连接快速变化的信号,并在全球范围推广成功的工作流。
Sentence Transformers v6.0 新增第四种模型类型 MultiVectorEncoder,用于 ColBERT 式晚交互检索,PyLate 与 Stanford-NLP ColBERT 检查点可直接加载,colpali-engine 的视觉文档检索模型也能通过同一套 API 使用。
推荐理由:Sentence Transformers v6.0 新增多向量编码器,读者可据此判断晚交互检索的接入方式与索引成本。
Hugging Face 构建了一个约束感知的 GPU 分配器,在七个基准场景中与 FIFO 调度器对比,相同硬件和负载下 GPU 利用率最高提升 33 个百分点,优先级加权产出在所有场景中均上升,最高增幅 105%。
Google Research 提出 PhotoScan,一个可从标准 2D 手机照片估算体脂率、Android-to-Gynoid 脂肪比(A/G)和内脏与皮下脂肪面积比(V/S)的深度学习框架。
OpenAI 发文探讨 AI 如何同时改变网络攻击与防御的格局,并介绍其自身正在强化的防御措施。文章同时给出安全团队当下可以采取的行动建议。