跳到正文
3月26日周四
  1. Google DeepMind65

    Google DeepMind 发布 Lyria 3 Pro,支持最长 3 分钟曲目与段落级控制

    Google DeepMind 发布音乐生成模型 Lyria 3 Pro,可生成最长 3 分钟的曲目,并能按前奏、主歌、副歌、桥段等结构元素进行提示控制。该模型已在 Vertex AI 公开预览,并接入 Google AI Studio、Gemini API、Google Vids、Gemini 应用和 ProducerAI。

    推荐理由:Lyria 3 Pro 把单曲生成时长拉到 3 分钟并支持段落级提示,读者可据此判断音乐生成在创作流程中的可用边界。

3月25日周三
  1. Google Research60

    Google 发布 Vibe Coding XR,用 Gemini 与 XR Blocks 生成 Android XR 应用

    Google 发布 Vibe Coding XR 工作流,将 Gemini 与基于 WebXR 的 XR Blocks 框架结合,把自然语言提示直接转成可运行的 Android XR 应用,官方称耗时在 60 秒以内。

    推荐理由:Google 把 Gemini 与 XR Blocks 组合成自然语言生成 XR 应用的流程,并给出 VCXR60 初步评测数据,可据此判断 XR 原型开发门槛的变化。

  2. Google Research62

    Google 发布 TurboQuant 等向量量化算法,将 KV cache 压缩至 3 bit

    Google Research 提出 TurboQuant 压缩算法,并配套 QJL 和 PolarQuant 两种方法,用于解决向量量化中的内存开销问题,相关论文将分别在 ICLR 2026 和 AISTATS 2026 发表。

    推荐理由:Google 提出 TurboQuant 等三种向量量化算法,可在不损失精度的前提下把 KV cache 压到 3 bit,并给出与基线的对比数据。

3月18日周三
  1. Google DeepMind46

    Google DeepMind 发布 AGI 认知框架,并启动 Kaggle 黑客松

    Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,提出包含感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决、社会认知 10 项能力的认知分类框架,并配套三阶段评估协议,用留出测试集防数据污染、采集具人口代表性的人类基线、将 AI 表现映射到人类表现分布。

3月17日周二
  1. Google Research40

    Google 用高温超导研究问题测试 LLM 世界模型

    Google 与康奈尔大学合作,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位专家按 6 项指标盲评打分。基于 1,726 篇受控文献的 NotebookLM 在多数维度表现最佳,自建 RAG 系统紧随其后,所有系统均有待改进之处。

3月12日周四
  1. Google Research62

    Google 推出 Groundsource:用 Gemini 将新闻报道转为灾害数据

    Google Research 推出 Groundsource,用 Gemini 从新闻报道中提取结构化灾害数据,首个开放数据集包含 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。

    推荐理由:Google 用 Gemini 从 80 种语言的新闻中抽取洪水事件,其准确率与覆盖范围可供评估 LLM 构建科学基准数据的可行性。

  2. Google Research62

    Google 与 BIDMC 开展 AMIE 对话式诊断 AI 真实临床可行性研究

    Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,全程由医生通过视频监督。

    推荐理由:Google 与 BIDMC 的这项前瞻性研究给出了 AMIE 在真实门诊流程中的安全与诊断数据,可对照其与 PCP 的差异。

3月9日周一
3月7日周六
  1. Google Research62

    Google Research 发布 WAXAL:覆盖 27 种非洲语言的大规模开放语音数据集

    Google Research 发布 WAXAL 大规模开放语音数据集,覆盖 27 种撒哈拉以南非洲语言、超过 1 亿使用者,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音和超过 565 小时用于 TTS 的高保真录音,由非洲高校与社区组织主导采集,Google 提供方法指导。项目自 2021 年启动,Google 表示将持续扩充语言覆盖。

    推荐理由:Google Research 联合非洲高校发布 27 种语言的语音数据集,可了解低资源语言语音数据的采集方法与开放许可安排。

  2. Google Research38

    Google SpeciesNet:用 AI 识别野生动物,一年间在全球保护项目落地

    Google 开源的 SpeciesNet 模型可识别相机陷阱图像中近 2,500 个动物类别,训练数据达 6,500 万张标注图像,在标准笔记本上每天可处理约 3 万张图像,低端游戏 GPU 上可处理 25 万张以上。该模型一年前作为开源工具发布,已被哥伦比亚、爱达荷、澳大利亚和坦桑尼亚塞伦盖蒂等地的研究团队用于识别美洲狮、麋鹿、鹤鸵和狮子等物种。

3月5日周四
  1. Google Research38

    Google 研究:用贝叶斯教学让 LLM 学会概率推理

    Google Research 提出"贝叶斯教学",通过监督微调让 LLM 模仿贝叶斯助手在航班推荐任务中的预测,从而学会按贝叶斯方式更新对用户偏好的概率估计。实验显示,该方法不仅提升训练任务表现,还能泛化到其他任务;而未经训练的 LLM 表现明显逊于最优贝叶斯助手,且往往在单轮交互后性能就停滞。

3月4日周三
  1. Google DeepMind71

    Google DeepMind 发布 Gemini 3.1 Flash-Lite

    Google DeepMind 发布 Gemini 3.1 Flash-Lite,称其为 Gemini 3 系列中速度最快、成本最低的模型,定价为每百万输入 token 0.25 美元、每百万输出 token 1.50 美元。

    推荐理由:官方给出定价、速度与基准数据,可据此判断高并发场景下是否值得替换 2.5 Flash。

2月27日周五
2月20日周五
  1. Google DeepMind78

    Google DeepMind 发布 Gemini 3.1 Pro

    Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的核心推理升级,在 ARC-AGI-2 上取得 77.1% 的验证分数,官方称推理表现超过 3 Pro 两倍以上。

    推荐理由:官方给出 ARC-AGI-2 上 77.1% 的验证分数,并列出消费端与开发者端的同步开放渠道,可据此判断升级幅度与可用范围。

2月19日周四
  1. Google DeepMind71

    Gemini 应用上线 Lyria 3 音乐生成,支持文本与图片生成 30 秒曲目

    Google DeepMind 的 Lyria 3 音乐生成模型以 beta 形式在 Gemini 应用上线,用户用文本或上传图片、视频即可生成 30 秒带歌词或纯器乐的曲目,并附由 Nano Banana 生成的封面图。

    推荐理由:官方披露 Lyria 3 在 Gemini 应用中的生成方式、时长与 SynthID 音频验证能力,可据此判断音乐生成的使用边界。

2月18日周三
2月17日周二
2月13日周五
  1. Google DeepMind80

    Google DeepMind 发布 Gemini 3 Deep Think 升级版

    Google DeepMind 发布 Gemini 3 Deep Think 重大升级,面向科学、研究与工程难题,已在 Gemini 应用中向 Google AI Ultra 订阅用户开放,并首次通过 Gemini API 向部分研究者、工程师和企业提供早期访问。

    推荐理由:官方给出 Deep Think 在 HLE、ARC-AGI-2、Codeforces 等基准上的具体成绩,并首次开放 API 早期访问,可据此判断其科研与工程场景的可用性。

2月11日周三
2月10日周二
2月5日周四
2月4日周三
  1. Google Research30

    Google Research 提出 Sequential Attention:让 AI 模型更轻更快且不牺牲准确率

    Google Research 提出 Sequential Attention,用贪心选择机制逐步、自适应地挑选要加入模型的层、模块或特征,并将选择过程直接整合进单次模型训练,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,实现快速单遍贪心选择,同时提升效率与可解释性,可扩展至大规模特征选择。

  2. Google Research62

    Google 与 Included Health 合作开展全国性随机研究评估虚拟护理中的对话 AI

    Google 宣布与 Included Health 合作,待 IRB 批准后启动一项全国性前瞻性随机对照研究,在真实虚拟护理工作流中评估对话 AI 的表现。

    推荐理由:Google 与 Included Health 合作开展全国性随机对照研究,读者可了解医疗对话 AI 从模拟走向真实临床的评估路径。

1月30日周五
  1. Google DeepMind71

    Google DeepMind 向美国 AI Ultra 订阅用户开放 Project Genie 世界模型原型

    Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅用户开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,支持创建、探索和混编交互式世界。

    推荐理由:Google DeepMind 把 Genie 3 世界模型做成可交互原型,读者可据此了解世界模型从研究走向订阅制产品的路径。

1月28日周三
  1. Google Research40

    Google Research 提出 ATLAS:多语言模型预训练、微调与解码多语言诅咒的实用缩放定律

    Google Research 提出 ATLAS(自适应迁移缩放定律),基于 774 次训练运行、10M–8B 参数模型、400+ 语言数据,给出多语言模型的最优模型规模、数据量与语言配比建议。ATLAS 通过跨语言迁移矩阵量化 1400 对语言间的互助与干扰,并给出语言数翻倍时模型规模扩 1.18x、数据扩 1.66x 的规则。该研究将在 ICLR 2026 展示。

1月24日周六
1月23日周五
  1. Google Research34

    Google 研究:用小模型分解式方法实现更优用户意图提取

    Google Research 在 EMNLP 2025 发表的论文提出一种分解式方法,让小型多模态 LLM 在设备端理解用户意图:先逐屏总结每次交互,再从摘要序列中提取意图。该方法在移动端和网页轨迹上均优于 CoT 提示和端到端微调,Gemini 1.5 Flash 8B 的效果可媲美 Gemini 1.5 Pro,成本与速度却大幅占优。

1月16日周五
  1. Google Research42

    Google 研究:用 Pixel Watch 智能手表估算步态指标,精度媲美手机

    Google 研究团队开发了一种基于时序卷积网络(TCN)的多头深度学习模型,仅凭 Pixel Watch 1 的 IMU 信号和用户身高,即可直接估算步速、步长、摆动时间、支撑时间等多项步态指标。在 246 名参与者、约 7 万段步行数据的验证中,手表估算与手机结果无显著差异(p>0.05),多数指标 Pearson r 与 ICC 均超过 0.80。

1月14日周三
  1. Google DeepMind71

    Google DeepMind 更新 Veo 3.1 Ingredients to Video,新增原生竖屏与 1080p/4K 放大

    Google DeepMind 更新 Veo 3.1 Ingredients to Video,让基于参考图生成的视频在短提示词下更富表现力,并提升角色身份、背景与物体的一致性。

    推荐理由:官方说明了 Ingredients to Video 在角色一致性与竖屏输出上的具体变化,可据此判断移动端短视频工作流是否值得迁移。

1月13日周二
  1. Google Research60

    NeuralGCM 用 AI 改进全球长期降水模拟

    Google Research 在 Science Advances 发表论文,介绍混合模型 NeuralGCM 直接以 2001 至 2018 年 NASA 卫星降水观测训练其机器学习部分,而非依赖再分析数据。

    推荐理由:原文给出 NeuralGCM 在降水模拟上的误差下降与极端降水改进,可对照传统参数化方案的局限。

12月24日周三