Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算孤岛并以异步数据流连接,降低带宽需求并隔离硬件故障。
推荐理由:原文给出分布式训练在带宽、容错和跨代硬件上的实测结果,可据此判断大规模预训练基础设施的演进方向。
公司与模型
Google 与 DeepMind 的 AI 动态:Gemini 系列、Veo 视频模型、研究成果与产品生态的持续追踪。
122 条精选近 30 天 13 条共收录 240 条
Google DeepMind 发布 Decoupled DiLoCo 分布式训练架构,将训练拆分为解耦的计算孤岛并以异步数据流连接,降低带宽需求并隔离硬件故障。
推荐理由:原文给出分布式训练在带宽、容错和跨代硬件上的实测结果,可据此判断大规模预训练基础设施的演进方向。
Google Research 在 ICLR 论文中提出智能体记忆框架 ReasoningBank,从成功和失败经验中提炼高层推理模式,用于测试时自我进化。
推荐理由:Google Research 的 ICLR 论文提出从成功与失败经验中提炼推理记忆的框架,并给出 WebArena 与 SWE-Bench-Verified 上的对比数据。
Google DeepMind 发布 Gemini 3.1 Flash TTS,称其在可控性、表达力和语音质量上均有提升,并引入可用自然语言指令控制语气、语速和表达方式的音频标签。
推荐理由:官方给出新语音模型的音频标签控制方式、Elo 分数与多语言覆盖,可据此判断表达力控制的实际粒度。
Google DeepMind 发布 Gemini Robotics-ER 1.6,这是其面向机器人的推理优先模型升级版,重点增强空间推理与多视角理解,并新增仪表读数能力,可读取压力表、液位计和数字读数。
推荐理由:官方给出与上一代及 Gemini 3.0 Flash 的对比,并首次加入仪表读数能力,可据此判断机器人在设施巡检场景的可用性。
Google DeepMind 发布 Gemma 4 开源模型家族,包含 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,采用 Apache 2.0 许可。
推荐理由:Gemma 4 以 Apache 2.0 开源并覆盖从手机到工作站的四种尺寸,读者可据此判断本地部署与微调的选择空间。
Google DeepMind 的 Gemma 4 多模态模型家族已在 Hugging Face 发布,采用 Apache 2.0 许可,支持图像、文本和音频输入并输出文本。
推荐理由:Hugging Face 官方给出 Gemma 4 五个尺寸的架构细节、部署路径与基准数据,可据此判断端侧多模态选型。
Google Quantum AI 发布白皮书,称未来量子计算机破解保护加密货币的椭圆曲线加密所需的 qubit 和门数比此前认为的更少。
推荐理由:Google Quantum AI 给出破解 ECDLP-256 所需量子资源的新估算,并说明如何在不泄露攻击细节的前提下公开漏洞。
Google DeepMind 公布 AI 指针的实验性方案,由 Gemini 驱动,让指针理解用户指向的内容及其对用户的意义,并给出四条交互原则:保持工作流不中断、展示与说明、用「这个」和「那个」的简略表达、把像素变成可操作实体。
推荐理由:Google DeepMind 公开 AI 指针的四条交互原则,并说明其已进入 Chrome 与 Googlebook,读者可据此判断 AI 交互从提示词转向指向与语音的路径。
Google DeepMind 发布 Gemini 3.1 Flash Live,称其为目前质量最高的音频与语音模型,具备更高精度和更低延迟。该模型在 ComplexFuncBench Audio 上取得 90.8%,在 Scale AI 的 Audio MultiChallenge 上开启 thinking 后取得 36.1%,并支持多语言。
推荐理由:官方给出语音模型在函数调用与长程推理基准上的分数,并说明开发者、企业与普通用户三类入口的可用范围。
Google DeepMind 发布关于 AI 有害操纵的研究,称其为首个经实证验证的评测工具,并公开运行同类人类被试研究所需的全部材料。研究覆盖英国、美国、印度共 9 项实验、逾 10000 名参与者,聚焦金融与健康等高风险场景,发现 AI 在健康话题上的有害操纵效果最弱,且在一个领域的成功不能预测另一个领域。
推荐理由:原文公开了可复用的有害操纵评测工具与万人级实验数据,读者可据此了解AI操纵能力的测量方式与边界。
Google DeepMind 发布音乐生成模型 Lyria 3 Pro,可生成最长 3 分钟的曲目,并能按前奏、主歌、副歌、桥段等结构元素进行提示控制。该模型已在 Vertex AI 公开预览,并接入 Google AI Studio、Gemini API、Google Vids、Gemini 应用和 ProducerAI。
推荐理由:Lyria 3 Pro 把单曲生成时长拉到 3 分钟并支持段落级提示,读者可据此判断音乐生成在创作流程中的可用边界。
Google 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR 的 XR Blocks 框架结合,把自然语言提示直接转成可运行的 Android XR 应用,官方称耗时在 60 秒以内。
推荐理由:Google 把 Gemini 与 XR Blocks 组合成自然语言生成 XR 应用的流程,并给出 VCXR60 初步评测数据,可据此判断 XR 原型开发门槛的变化。
Google Research 提出 TurboQuant 压缩算法,并配套 QJL 和 PolarQuant 两种方法,用于解决向量量化中的内存开销问题,相关论文将分别在 ICLR 2026 和 AISTATS 2026 发表。
推荐理由:Google 提出 TurboQuant 等三种向量量化算法,可在不损失精度的前提下把 KV cache 压到 3 bit,并给出与基线的对比数据。
Google Research 在 The Check Up 活动上公布医疗 AI 的多项进展,覆盖个性化健康、临床协作、开发者生态与公共卫生等方向。
推荐理由:Google Research 集中披露医疗 AI 从研究走向临床的多条进展,可了解其落地路径与合作方式。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺癌检测系统在乳腺筛查中的应用。
推荐理由:两项 Nature Cancer 研究给出 AI 在 NHS 乳腺筛查中的前瞻部署数据,可了解人机双读流程的实际收益与仲裁环节风险。
Google 宣布在 Flood Hub 上线城市山洪(flash flood)预报,可提前最多 24 小时预测城市区域的山洪风险。
推荐理由:Google 把洪水预报从河流扩展到城市内涝,并给出与 NWS 同口径的精度对比,可据此判断全球预警覆盖的差距。
Google Research 推出 Groundsource,用 Gemini 从新闻报道中提取结构化灾害数据,首个开放数据集包含 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。
推荐理由:Google 用 Gemini 从 80 种语言的新闻中抽取洪水事件,其准确率与覆盖范围可供评估 LLM 构建科学基准数据的可行性。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,全程由医生通过视频监督。
推荐理由:Google 与 BIDMC 的这项前瞻性研究给出了 AMIE 在真实门诊流程中的安全与诊断数据,可对照其与 PCP 的差异。
Google Research 发布 WAXAL 大规模开放语音数据集,覆盖 27 种撒哈拉以南非洲语言、超过 1 亿使用者,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音和超过 565 小时用于 TTS 的高保真录音,由非洲高校与社区组织主导采集,Google 提供方法指导。项目自 2021 年启动,Google 表示将持续扩充语言覆盖。
推荐理由:Google Research 联合非洲高校发布 27 种语言的语音数据集,可了解低资源语言语音数据的采集方法与开放许可安排。
Google DeepMind 发布 Gemini 3.1 Flash-Lite,称其为 Gemini 3 系列中速度最快、成本最低的模型,定价为每百万输入 token 0.25 美元、每百万输出 token 1.50 美元。
推荐理由:官方给出定价、速度与基准数据,可据此判断高并发场景下是否值得替换 2.5 Flash。