Google Research 推出 S2Vec:用自监督学习读懂城市建成环境
Google Research 发布自监督框架 S2Vec,将道路、建筑等建成环境特征栅格化为多层图像,通过掩码自编码(MAE)学习通用嵌入向量,无需人工标注即可预测人口密度、收入等指标。
Google Research 发布自监督框架 S2Vec,将道路、建筑等建成环境特征栅格化为多层图像,通过掩码自编码(MAE)学习通用嵌入向量,无需人工标注即可预测人口密度、收入等指标。
Google Research 在 The Check Up 活动上公布医疗 AI 的多项进展,覆盖个性化健康、临床协作、开发者生态与公共卫生等方向。
推荐理由:Google Research 集中披露医疗 AI 从研究走向临床的多条进展,可了解其落地路径与合作方式。
Google Research 与多家 NHS 机构合作的 AIMS 研究在 Nature Cancer 发表两项姊妹研究,评估 AI 乳腺癌检测系统在乳腺筛查中的应用。
推荐理由:两项 Nature Cancer 研究给出 AI 在 NHS 乳腺筛查中的前瞻部署数据,可了解人机双读流程的实际收益与仲裁环节风险。
Google DeepMind 发布论文《Measuring Progress Toward AGI: A Cognitive Taxonomy》,提出包含感知、生成、注意力、学习、记忆、推理、元认知、执行功能、问题解决、社会认知 10 项能力的认知分类框架,并配套三阶段评估协议,用留出测试集防数据污染、采集具人口代表性的人类基线、将 AI 表现映射到人类表现分布。
Google 与康奈尔大学合作,让 GPT-4o、Perplexity、Claude 3.5、Gemini Advanced Pro 1.5、NotebookLM 和一套自建 RAG 系统回答 67 道高温超导专家级问题,由 12 位专家按 6 项指标盲评打分。基于 1,726 篇受控文献的 NotebookLM 在多数维度表现最佳,自建 RAG 系统紧随其后,所有系统均有待改进之处。
Google 宣布在 Flood Hub 上线城市山洪(flash flood)预报,可提前最多 24 小时预测城市区域的山洪风险。
推荐理由:Google 把洪水预报从河流扩展到城市内涝,并给出与 NWS 同口径的精度对比,可据此判断全球预警覆盖的差距。
Google Research 推出 Groundsource,用 Gemini 从新闻报道中提取结构化灾害数据,首个开放数据集包含 260 万条城市山洪记录,覆盖 150 多个国家、时间跨度从 2000 年至今。
推荐理由:Google 用 Gemini 从 80 种语言的新闻中抽取洪水事件,其准确率与覆盖范围可供评估 LLM 构建科学基准数据的可行性。
Google Research 与 Beth Israel Deaconess Medical Center 合作开展了一项前瞻性单中心可行性研究,让 AMIE 在门诊初级保健就诊前与患者进行文本问诊,全程由医生通过视频监督。
推荐理由:Google 与 BIDMC 的这项前瞻性研究给出了 AMIE 在真实门诊流程中的安全与诊断数据,可对照其与 PCP 的差异。
AlphaGo 击败世界冠军十年后,其深度神经网络结合搜索与强化学习的方法已延伸至蛋白质折叠、数学推理和算法发现。AlphaFold 2 破解了 50 年历史的蛋白质折叠难题,折叠了科学界已知的全部 2 亿个蛋白质结构并开源,全球超 300 万研究人员正在使用该数据库。
Google Research 发布 WAXAL 大规模开放语音数据集,覆盖 27 种撒哈拉以南非洲语言、超过 1 亿使用者,采用 CC-BY-4.0 许可。数据集包含约 1,846 小时用于 ASR 的转写自然语音和超过 565 小时用于 TTS 的高保真录音,由非洲高校与社区组织主导采集,Google 提供方法指导。项目自 2021 年启动,Google 表示将持续扩充语言覆盖。
推荐理由:Google Research 联合非洲高校发布 27 种语言的语音数据集,可了解低资源语言语音数据的采集方法与开放许可安排。
Google 开源的 SpeciesNet 模型可识别相机陷阱图像中近 2,500 个动物类别,训练数据达 6,500 万张标注图像,在标准笔记本上每天可处理约 3 万张图像,低端游戏 GPU 上可处理 25 万张以上。该模型一年前作为开源工具发布,已被哥伦比亚、爱达荷、澳大利亚和坦桑尼亚塞伦盖蒂等地的研究团队用于识别美洲狮、麋鹿、鹤鸵和狮子等物种。
Google Research 提出"贝叶斯教学",通过监督微调让 LLM 模仿贝叶斯助手在航班推荐任务中的预测,从而学会按贝叶斯方式更新对用户偏好的概率估计。实验显示,该方法不仅提升训练任务表现,还能泛化到其他任务;而未经训练的 LLM 表现明显逊于最优贝叶斯助手,且往往在单轮交互后性能就停滞。
Google DeepMind 发布 Gemini 3.1 Flash-Lite,称其为 Gemini 3 系列中速度最快、成本最低的模型,定价为每百万输入 token 0.25 美元、每百万输出 token 1.50 美元。
推荐理由:官方给出定价、速度与基准数据,可据此判断高并发场景下是否值得替换 2.5 Flash。
Google DeepMind 发布图像生成模型 Nano Banana 2(Gemini 3.1 Flash Image),把 Nano Banana Pro 的世界知识、推理与画质带到 Flash 速度。
推荐理由:官方给出 Nano Banana 2 的能力清单与上线渠道,读者可据此判断 Pro 级图像能力下放到 Flash 速度后的可用范围。
Google DeepMind 发布 Gemini 3.1 Pro,定位为面向复杂任务的核心推理升级,在 ARC-AGI-2 上取得 77.1% 的验证分数,官方称推理表现超过 3 Pro 两倍以上。
推荐理由:官方给出 ARC-AGI-2 上 77.1% 的验证分数,并列出消费端与开发者端的同步开放渠道,可据此判断升级幅度与可用范围。
Google DeepMind 的 Lyria 3 音乐生成模型以 beta 形式在 Gemini 应用上线,用户用文本或上传图片、视频即可生成 30 秒带歌词或纯器乐的曲目,并附由 Nano Banana 生成的封面图。
推荐理由:官方披露 Lyria 3 在 Gemini 应用中的生成方式、时长与 SynthID 音频验证能力,可据此判断音乐生成的使用边界。
Google Research 提出 MapTrace,一套用 Gemini 2.5 Pro 与 Imagen-4 自动生成地图寻路数据的流水线,并开源 200 万条问答对。
Google DeepMind 宣布与印度政府机构及本地机构建立 National Partnerships for AI 合作,向印度研究人员开放 AlphaGenome、AI Co-scientist、Earth AI 等前沿科学模型,并推出 3000 万美元的 Google.org Impact Challenge: AI for Science。
Google DeepMind 发布 Gemini 3 Deep Think 重大升级,面向科学、研究与工程难题,已在 Gemini 应用中向 Google AI Ultra 订阅用户开放,并首次通过 Gemini API 向部分研究者、工程师和企业提供早期访问。
推荐理由:官方给出 Deep Think 在 HLE、ARC-AGI-2、Codeforces 等基准上的具体成绩,并首次开放 API 早期访问,可据此判断其科研与工程场景的可用性。
Google Research 发布开源原型框架 DialogLab,用于创作、模拟和测试动态的人机群组对话,已在 ACM UIST 2025 展示。该框架将对话的社会设定与时间流程解耦,支持拖拽式场景搭建、human control 实时干预和对话动态可视化验证。
Google DeepMind 于 2025 年 8 月发布的生物声学基础模型 Perch 2.0 主要用鸟类等陆生动物音频训练,却在未接触任何水下音频的情况下,作为嵌入模型在海洋任务迁移学习中表现优异。
Google DeepMind 发布两篇论文,介绍由 Gemini Deep Think 驱动的数学研究智能体 Aletheia 及跨学科研究案例。
推荐理由:DeepMind 公开了 Gemini Deep Think 在数学与理论计算机科学研究中的两篇论文,读者可了解其智能体工作流与分级评估方式。
Google 提出 Natively Adaptive Interfaces(NAI)框架,用多模态 AI 工具打造更具适应性的无障碍应用,以 Orchestrator 协调摘要、设置等子智能体替代静态导航。
Google Research 提出 Sequential Attention,用贪心选择机制逐步、自适应地挑选要加入模型的层、模块或特征,并将选择过程直接整合进单次模型训练,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,实现快速单遍贪心选择,同时提升效率与可解释性,可扩展至大规模特征选择。
Google 宣布与 Included Health 合作,待 IRB 批准后启动一项全国性前瞻性随机对照研究,在真实虚拟护理工作流中评估对话 AI 的表现。
推荐理由:Google 与 Included Health 合作开展全国性随机对照研究,读者可了解医疗对话 AI 从模拟走向真实临床的评估路径。
Google DeepMind 开始向美国 18 岁以上的 Google AI Ultra 订阅用户开放 Project Genie,这是一个由 Genie 3、Nano Banana Pro 和 Gemini 驱动的实验性研究原型,支持创建、探索和混编交互式世界。
推荐理由:Google DeepMind 把 Genie 3 世界模型做成可交互原型,读者可据此了解世界模型从研究走向订阅制产品的路径。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 组智能体配置做大规模对照评测,得出首批智能体系统的量化缩放原则,指出“智能体越多越好”常会触顶甚至降低表现。
Google Research 提出 ATLAS(自适应迁移缩放定律),基于 774 次训练运行、10M–8B 参数模型、400+ 语言数据,给出多语言模型的最优模型规模、数据量与语言配比建议。ATLAS 通过跨语言迁移矩阵量化 1400 对语言间的互助与干扰,并给出语言数翻倍时模型规模扩 1.18x、数据扩 1.66x 的规则。该研究将在 ICLR 2026 展示。
Google Research 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,在多样性与效用之间取得平衡。GIST 在图像分类等任务上超越现有 SOTA 基准,并首次为该多样性-效用权衡提供可证明的近似保证:所选子集价值至少为最优解的一半。
Google Research 在 EMNLP 2025 发表的论文提出一种分解式方法,让小型多模态 LLM 在设备端理解用户意图:先逐屏总结每次交互,再从摘要序列中提取意图。该方法在移动端和网页轨迹上均优于 CoT 提示和端到端微调,Gemini 1.5 Flash 8B 的效果可媲美 Gemini 1.5 Pro,成本与速度却大幅占优。
Google DeepMind 发布 D4RT(Dynamic 4D Reconstruction and Tracking),用统一的编码器-解码器 Transformer 架构完成动态场景的 4D 重建与追踪。
推荐理由:D4RT 把动态场景重建统一进单一框架,并给出 18x 至 300x 的加速数据,可据此判断 4D 重建的实时化路径。
Google 研究团队开发了一种基于时序卷积网络(TCN)的多头深度学习模型,仅凭 Pixel Watch 1 的 IMU 信号和用户身高,即可直接估算步速、步长、摆动时间、支撑时间等多项步态指标。在 246 名参与者、约 7 万段步行数据的验证中,手表估算与手机结果无显著差异(p>0.05),多数指标 Pearson r 与 ICC 均超过 0.80。
Google Research 利用 Android Auto 采集的急刹车事件(HBE,减速度超过 -3m/s²)与弗吉尼亚州、加州十年公开碰撞数据,通过负二项回归验证了 HBE 频率与路段碰撞率之间存在统计显著的正相关。
Google 通过 HAI-DEF 项目发布 MedGemma 1.5 4B,新增对 CT、MRI 和全切片病理等高维医学影像的支持,并保留 2D 图像与文本能力。
推荐理由:官方给出 MedGemma 1.5 与 MedASR 的基准对比和开源入口,可据此判断医疗多模态模型的可用边界。
Google DeepMind 更新 Veo 3.1 Ingredients to Video,让基于参考图生成的视频在短提示词下更富表现力,并提升角色身份、背景与物体的一致性。
推荐理由:官方说明了 Ingredients to Video 在角色一致性与竖屏输出上的具体变化,可据此判断移动端短视频工作流是否值得迁移。
Google Research 在 Science Advances 发表论文,介绍混合模型 NeuralGCM 直接以 2001 至 2018 年 NASA 卫星降水观测训练其机器学习部分,而非依赖再分析数据。
推荐理由:原文给出 NeuralGCM 在降水模拟上的误差下降与极端降水改进,可对照传统参数化方案的局限。
Google 发布 2025 年度研究回顾,梳理了 8 大突破领域。模型方面,Gemini 2.5 于 3 月发布,Gemini 3 于 11 月推出,Gemini 3 Flash 于 12 月上线,其中 Gemini 3 Pro 登顶 LMArena 排行榜,并在 MathArena Apex 上取得 23.4% 的 SOTA 成绩。
Google Research 发布 2025 年度回顾,Gemini 3 成为其事实性最强的 LLM,在 SimpleQA Verified 和 FACTS 基准上达到 SOTA,并在 Gemini 3 中引入生成式 UI。Gemma 扩展至 140 多种语言,成为当前最佳多语言开源模型;量子方面,Willow 芯片上的 Quantum Echoes 算法比最强经典算法快 13000 倍。
Google DeepMind 发布 Gemini 3 Flash,定位为兼顾前沿智能与速度、成本更低的模型,已在 Gemini API、Google AI Studio、Gemini CLI、Google Antigravity、Vertex AI 和 Gemini Enterprise 上线,并开始向 Gemini 应用和搜索 AI Mode 全量推送。
推荐理由:官方给出 Gemini 3 Flash 的基准分数、定价与上线渠道,可据此判断速度与成本权衡是否适合自身工作流。
Google DeepMind 发布 Gemma Scope 2,一套面向 Gemma 3 全系列(270M 至 27B 参数)的开源可解释性工具。该套件结合稀疏自编码器(SAEs)与 transcoders,覆盖模型每一层,并新增 skip-transcoders、跨层 transcoders 及针对聊天版本的越狱、拒答和思维链忠实度分析工具。
推荐理由:Gemma Scope 2 覆盖 Gemma 3 全系列并公开工具与演示,读者可了解可解释性工具在模型安全审计上的最新进展。