Google 提出 Urania:用差分隐私框架分析 AI 聊天机器人使用情况
Google 在 COLM 2025 论文中提出 Urania 框架,通过差分隐私(DP)聚类与 DP 关键词提取,从 LLM 聊天机器人对话中生成使用洞察,且 LLM 只接触匿名关键词、不接触原始对话。与基于 CLIO 的非隐私基线 Simple-CLIO 相比,其隐私摘要在一项评测中最高有 70% 的概率被 LLM 评估器偏好。隐私预算越紧,主题覆盖度越低,但摘要更简洁聚焦。
Google 在 COLM 2025 论文中提出 Urania 框架,通过差分隐私(DP)聚类与 DP 关键词提取,从 LLM 聊天机器人对话中生成使用洞察,且 LLM 只接触匿名关键词、不接触原始对话。与基于 CLIO 的非隐私基线 Simple-CLIO 相比,其隐私摘要在一项评测中最高有 70% 的概率被 LLM 评估器偏好。隐私预算越紧,主题覆盖度越低,但摘要更简洁聚焦。
Google DeepMind 宣布深化与英国政府的合作,向英国科学家优先开放 AlphaEvolve、AlphaGenome、AI co-scientist 和 WeatherNext 等 AI for Science 模型,并计划 2026 年在英国建立其首个自动化实验室,专注材料科学研究,实验室将与 Gemini 深度集成。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,在原有 FACTS Grounding 基础上新增 Parametric、Search、Multimodal 三项基准,并将 Grounding 升级至 v2,共 3513 个公开样例,另设私有留出集。
Google Research 发布 Titans 架构与 MIRAS 理论框架,将 RNN 的速度与 Transformer 的精度结合,通过深度神经网络作为长期记忆模块实现测试时记忆。
推荐理由:Google 提出 Titans 架构与 MIRAS 框架,用深度神经网络做长期记忆模块,为超长上下文建模提供新思路。
密歇根州立大学团队借助 AlphaFold 预测植物与嗜热藻类的甘油酸激酶(GLYK)三维结构,发现植物版 GLYK 的三个柔性环在高温下变形失稳。他们用藻类 GLYK 中更刚性的环替换这些不稳定片段,构建的杂合酶中有一个在高达 65 °C 下仍保持稳定,为培育耐热作物提供了路径。
Hugging Face 推出 Hugging Face Skills,让 Claude Code 等编码智能体直接提交云端 GPU 微调任务、监控进度并把模型推送到 Hub。
推荐理由:原文给出了一套可复用的技能包与完整操作流程,读者可据此让编码智能体接管微调全流程。
Intel AI Software Group 推出 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调的数学推理 Agent,通过 smolagents 生成 Python 片段并在沙箱中执行,将结果折回推理过程。
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用于标准化评测声音嵌入模型的八项核心能力,涵盖检索、推理、分类、转录、分割、聚类、重排与重建。
OpenAI 宣布收购 Neptune,以加深对模型行为的可见性,并强化研究人员用于追踪实验和监控训练的工具。官方说明未披露交易金额与其他细节。
推荐理由:OpenAI 收购 Neptune 的官方说明,可了解其加强模型行为追踪与训练监控工具链的意图。
Google DeepMind 发布研究,科学家借助 AlphaFold 与冷冻电镜结合,解析了“坏胆固醇”低密度脂蛋白(LDL)关键蛋白 apoB100 的结构。
推荐理由:AlphaFold 与冷冻电镜结合解析 apoB100 结构,读者可了解 AI 在结构生物学中的具体协作方式。
OpenAI 公布首批研究案例,展示 GPT-5 在数学、物理、生物学和计算机科学领域加速科学进展。这些实验呈现 AI 与研究人员如何协作生成证明、发现新见解,并改变科学发现的速度。
Google DeepMind 与 Google Research 发布天气预报模型 WeatherNext 2,称其生成预报速度比前代快 8 倍,分辨率最高可达 1 小时,并能在单个 TPU 上不到一分钟生成数百种可能天气情景。
推荐理由:官方给出 8 倍生成速度、1 小时分辨率与 99.9% 变量超越前代等指标,可据此判断 AI 天气预报的可用性边界。
Google DeepMind 联合 Google Research 发布 "Natural Forests of the World 2020" 地图与数据集,这是首个全球一致、10 米分辨率、能区分天然林与其他树木覆盖的地图,在独立全球数据集上验证准确率达 92.2%。
Google 发布 JAX-Privacy 1.0,这是构建在 JAX 之上、用于训练和审计差分隐私(DP)模型的工具库,重新设计以提升模块化。它提供逐样本梯度裁剪、噪声添加、数据批构建等核心组件,支持 DP-SGD、DP-FTRL 及 DP matrix factorization 等算法,并借助 JAX 的 vmap、shard_map 实现数据与模型并行的大规模训练。
Google DeepMind 在 Nature 发表新论文,分析 AI 视觉模型与人类在视觉表征组织上的差异,并提出一种三步对齐方法。该方法先用 THINGS 数据集训练一个冻结主模型的小适配器作为教师模型,再生成包含百万张图像、数百万条类人判断的 AligNet 数据集,最后微调其他学生模型。
北爱尔兰 C2k 与 Google for Education 合作的六个月试点中,100 名教师将 Gemini 和 Google Workspace 引入课堂,每位参与教师平均每周节省 10 小时,并沉淀出 600 多个 Gemini 使用场景。
Google Research 在 NeurIPS 2025 论文《Nested Learning: The Illusion of Deep Learning Architectures》中提出 Nested Learning,把模型架构与优化算法视为同一套相互嵌套、并行优化的多层级学习问题,以缓解持续学习中的灾难性遗忘。
Google 推出数据科学智能体 DS-STAR,通过数据文件分析、LLM 评判验证和顺序规划迭代三项创新,在 DABStep、KramaBench、DA-Code 三个基准上超越 AutoGen 和 DA-Agent,准确率分别从 41.0% 提升至 45.2%、39.8% 提升至 44.7%、37.0% 提升至 38.5%,并登顶 DABStep 公开排行榜。
Google 发布森林砍伐风险预测基准数据集,基于纯卫星输入和 vision transformer 架构,可在 30 米尺度上预测砍伐风险。Google 同时用结合 AlphaEarth Foundations 卫星嵌入向量的 GNN 模型绘制物种分布图,并通过 UN Biodiversity Lab 和 Earth Engine 发布 23 张物种地图。
Google 发布 ForestCast,用纯卫星数据与视觉 Transformer 预测森林砍伐风险,并公开首个面向该任务的深度学习基准数据集。模型仅输入 Landsat、Sentinel 2 及“变化历史”数据,精度可匹敌或超过依赖道路等专用地图的传统方法,其中变化历史是最关键输入。相关训练与评估数据已开放,供社区复现并构建更优模型。
OpenAI 发布 IndQA,一个用于评估 AI 系统印度语言能力的新基准,由领域专家共建,覆盖 12 种语言和 10 个知识领域,重点考察文化理解与推理能力。
一篇新文章提出用"分治"范式替代时序差分(TD)学习来做 off-policy 强化学习,通过将轨迹对半切分并组合子段价值来更新整体价值,理论上把 Bellman 递归次数从线性降到对数级。作者与 Aditya 合作的工作首次将分治价值学习扩展到目标条件强化学习这类复杂任务,且无需像 n-step TD 那样调节超参数 n。目前该方法仍面临如何选取最优子目标 w 的难题。
MiniMax M2 的后训练团队分享了智能体对齐的核心经验:智能体需要交错思考(Interleaved Thinking),在任务全程而非仅在开头进行推理,以应对工具输出带来的持续扰动。团队发现,仅靠工具数量扩展无法实现泛化,真正的泛化要求模型对整个操作空间中的扰动保持稳定,包括系统提示词、用户提示词、环境和工具响应。M2 用户需保留包含思考步骤的完整会话历史,因为上下文就是它的记忆。
Hugging Face 发布分析文章,指出中国开源权重模型的推理已开始由华为昇腾、寒武纪等国产芯片承载,部分模型开始用国产芯片训练。文章认为美国出口管制与中国芯片产能提速高度相关,算力稀缺也促使 DeepSeek 的 MLA、GRPO 等效率创新走向开源,并推动 CUDA 之外的软件生态成形。
推荐理由:梳理中国开源模型与国产芯片互相牵引的路径,可看到算力受限如何反过来塑造模型架构与部署生态。
Hugging Face 改进 datasets 库的流式加载,load_dataset(streaming=True) 的启动请求最多减少 100 倍、数据文件解析快 10 倍、流式速度最多快 2 倍,256 并发 worker 下无崩溃。
推荐理由:原文给出流式加载的具体优化项与实测倍数,读者可据此判断大规模训练的数据读取成本能降到什么程度。
Hugging Face 发布 LeRobot v0.4.0,为开源机器人学习带来 LeRobotDataset v3.0、PI0.5 与 GR00T N1.5 等 VLA 模型,以及硬件插件系统。
推荐理由:LeRobot v0.4.0 把数据集、仿真环境、VLA 策略与硬件插件整合进同一开源栈,读者可据此判断机器人学习工具链的成熟度。
Hugging Face 发起 AI for Food Allergies 项目,计划建设首个社区驱动的研究实验室,探索 AI 如何推进食物过敏研究。全球约 2.2 亿人患有至少一种食物过敏,美国约占总人口 10%。项目将连接前沿 AI 与生物医学,开发开放协作项目,服务研究者、临床医生和患者。
NVIDIA 发布 Nemotron-Personas-India,首个对齐印度真实人口、地理与文化分布的开放合成 Indic 人物数据集,采用 CC BY 4.0 许可。
Hugging Face 发布 Retrieval Embedding Benchmark(RTEB)beta 版,用于评估 embedding 模型在真实应用中的检索准确率。该基准采用公开与私有数据集混合策略,私有部分由 MTEB 维护者评测,以检测模型在未见数据上的泛化能力,覆盖 20 种语言及法律、医疗、代码、金融等领域,默认榜单指标为 NDCG@10。
OpenAI 的研究助手帮助团队分析数百万条支持工单,更快提炼洞察,并在公司内部规模化地满足探索需求。
NVIDIA 发布 Nemotron-Personas-Japan,一个面向日语 AI 的开放合成人格数据集,采用 CC BY 4.0 许可,可商用与非商用。数据集含 100 万条记录、每条 6 个人格,共 600 万个人格,约 14 亿 token,覆盖约 95 万个独特姓名和 1500 多个职业类别。
Hugging Face 发布 Smol2Operator,基于 SmolVLM2-2.2B-Instruct 通过两阶段训练将其从零 GUI 定位能力打造成可执行点击、输入等操作的智能体式 GUI coder。第一阶段先建立界面元素定位能力,第二阶段用 SFT 增强智能体推理,在 ScreenSpot-v2 基准上评估,并开源全部训练配方、数据处理工具、模型、demo 与数据集。
Hugging Face 发布 SyGra,一个面向 LLM 和 SLM 的低代码/无代码数据构建框架,支持从 Q&A、SFT 到 DPO 偏好对、推理增强、多语言转换等数据集生成与转换。SyGra 提供 Python 库,兼容 vLLM、Hugging Face TGI、Triton、Ollama 等多种推理后端,可减少人工数据整理与工程投入。
Hugging Face 发布 LeRobotDataset v3.0,将多个 episode 打包进单个文件,并用关系型元数据在 episode 级别检索信息,解决 v2 单文件单 episode 在百万级数据集下的文件系统瓶颈。
WRITER 发布 Palmyra-mini 系列三款开源模型,参数规模 1.5B 至 1.7B,包括非思考基础版 palmyra-mini 及两款经 CoT 训练的推理变体 palmyra-mini-thinking-a 和 palmyra-mini-thinking-b。
Together AI 与 Hugging Face 联合推出新能力,Hugging Face Hub 上任意兼容的 LLM 均可通过 Together AI 基础设施微调,支持公开和私有仓库,训练完成后可自动回传至 Hub。
Hugging Face 发布 Jupyter Agent 项目,用约 2TB Kaggle notebook 经去重、教育性打分、QA 与轨迹生成,构建出 51k 合成 notebook、近 0.2B token 的数据集,微调 Qwen3-4B 做数据分析智能体。
Hugging Face 发布 mmBERT,一个基于 ModernBERT 架构的多语言编码器模型,在 3T+ tokens、1800 多种语言上训练,成为首个在性能上超越 XLM-R 的多语言模型。base 版含 110M 非嵌入参数(总计 307M),采用 Gemma 2 tokenizer,训练分三阶段将语言数从 60 逐步扩展至 1833,并引入逆掩码率调度与退火语言学习等新技术。
SandboxAQ 在 Hugging Face 开源 SAIR 数据集,包含超 500 万个 AI 生成的蛋白质-配体 3D 结构,每个结构均配对 ChEMBL 或 BindingDB 的实验 IC₅₀ 数据,采用 CC BY 4.0 许可免费开放。
伯克利 AI 研究提出首个可定量预测 word2vec 学习过程的理论,证明在现实训练条件下其学习问题可化简为无权重最小二乘矩阵分解,最终学到的表示等价于对目标矩阵 M* 做 PCA。