Google Research 提出 ATLAS:多语言模型预训练、微调与解码多语言诅咒的实用缩放定律
Google Research 提出 ATLAS(自适应迁移缩放定律),基于 774 次训练运行、10M–8B 参数模型、400+ 语言数据,给出多语言模型的最优模型规模、数据量与语言配比建议。ATLAS 通过跨语言迁移矩阵量化 1400 对语言间的互助与干扰,并给出语言数翻倍时模型规模扩 1.18x、数据扩 1.66x 的规则。该研究将在 ICLR 2026 展示。
Google Research 提出 ATLAS(自适应迁移缩放定律),基于 774 次训练运行、10M–8B 参数模型、400+ 语言数据,给出多语言模型的最优模型规模、数据量与语言配比建议。ATLAS 通过跨语言迁移矩阵量化 1400 对语言间的互助与干扰,并给出语言数翻倍时模型规模扩 1.18x、数据扩 1.66x 的规则。该研究将在 ICLR 2026 展示。
Hugging Face 团队推出阿联酋方言评测基准 Alyah(阿拉伯语意为"北极星"),包含 1,173 条由阿联酋母语者手工采集的样本,均为四选一选择题。
Google Research 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,在多样性与效用之间取得平衡。GIST 在图像分类等任务上超越现有 SOTA 基准,并首次为该多样性-效用权衡提供可证明的近似保证:所选子集价值至少为最优解的一半。
Google Research 在 EMNLP 2025 发表的论文提出一种分解式方法,让小型多模态 LLM 在设备端理解用户意图:先逐屏总结每次交互,再从摘要序列中提取意图。该方法在移动端和网页轨迹上均优于 CoT 提示和端到端微调,Gemini 1.5 Flash 8B 的效果可媲美 Gemini 1.5 Pro,成本与速度却大幅占优。
Hugging Face 推出 AssetOpsBench,一个面向工业资产生命周期管理的 AI 智能体评测基准,覆盖 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式。
微软 unilm 团队发布 Differential Transformer V2(DIFF V2),在保持 KV 头数量不变的前提下把 query 头数翻倍,使解码速度与标准 Transformer 持平,且不再需要自定义注意力 kernel。
推荐理由:微软团队给出 DIFF V2 的代码与消融对比,读者可据此理解差分注意力在解码速度与训练稳定性上的取舍。
Google 研究团队开发了一种基于时序卷积网络(TCN)的多头深度学习模型,仅凭 Pixel Watch 1 的 IMU 信号和用户身高,即可直接估算步速、步长、摆动时间、支撑时间等多项步态指标。在 246 名参与者、约 7 万段步行数据的验证中,手表估算与手机结果无显著差异(p>0.05),多数指标 Pearson r 与 ICC 均超过 0.80。
Google Research 利用 Android Auto 采集的急刹车事件(HBE,减速度超过 -3m/s²)与弗吉尼亚州、加州十年公开碰撞数据,通过负二项回归验证了 HBE 频率与路段碰撞率之间存在统计显著的正相关。
Google Research 在 Science Advances 发表论文,介绍混合模型 NeuralGCM 直接以 2001 至 2018 年 NASA 卫星降水观测训练其机器学习部分,而非依赖再分析数据。
推荐理由:原文给出 NeuralGCM 在降水模拟上的误差下降与极端降水改进,可对照传统参数化方案的局限。
伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,可直接从带噪测量中估计信息量,无需重建算法或任务专用解码器。该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证,信息估计能预测下游解码性能,优化后的设计达到 SOTA 端到端方法水平,且内存和算力需求更低。相关论文发表于 NeurIPS 2025。
OpenAI 推出针对思维链可监控性的新框架与评估套件,覆盖 24 种环境下的 13 项评估。结果显示,监控模型内部推理远比仅监控输出更有效,为 AI 系统能力提升后的可扩展控制提供了可行路径。
OpenAI 推出 FrontierScience 基准,用于测试 AI 在物理、化学和生物学领域的推理能力,衡量其向真实科学研究迈进的程度。
OpenAI 推出一个真实世界评估框架,用于衡量 AI 加速湿实验室生物研究的能力。该工作使用 GPT-5 优化分子克隆实验方案,同时探讨 AI 辅助实验的潜力与风险。
Google Research 为 STOC 2026 推出实验性 Paper Assistant Tool(PAT),基于 Gemini 2.5 Deep Think 的推理扩展方法,在投稿后 24 小时内为作者提供自动化预审反馈。
推荐理由:Google 官方披露 PAT 在 STOC 2026 的实测反馈数据,可了解 AI 辅助数学证明审阅的实际表现与局限。
Google 在 COLM 2025 论文中提出 Urania 框架,通过差分隐私(DP)聚类与 DP 关键词提取,从 LLM 聊天机器人对话中生成使用洞察,且 LLM 只接触匿名关键词、不接触原始对话。与基于 CLIO 的非隐私基线 Simple-CLIO 相比,其隐私摘要在一项评测中最高有 70% 的概率被 LLM 评估器偏好。隐私预算越紧,主题覆盖度越低,但摘要更简洁聚焦。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,在原有 FACTS Grounding 基础上新增 Parametric、Search、Multimodal 三项基准,并将 Grounding 升级至 v2,共 3513 个公开样例,另设私有留出集。
Google Research 发布 Titans 架构与 MIRAS 理论框架,将 RNN 的速度与 Transformer 的精度结合,通过深度神经网络作为长期记忆模块实现测试时记忆。
推荐理由:Google 提出 Titans 架构与 MIRAS 框架,用深度神经网络做长期记忆模块,为超长上下文建模提供新思路。
密歇根州立大学团队借助 AlphaFold 预测植物与嗜热藻类的甘油酸激酶(GLYK)三维结构,发现植物版 GLYK 的三个柔性环在高温下变形失稳。他们用藻类 GLYK 中更刚性的环替换这些不稳定片段,构建的杂合酶中有一个在高达 65 °C 下仍保持稳定,为培育耐热作物提供了路径。
Intel AI Software Group 推出 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调的数学推理 Agent,通过 smolagents 生成 Python 片段并在沙箱中执行,将结果折回推理过程。
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用于标准化评测声音嵌入模型的八项核心能力,涵盖检索、推理、分类、转录、分割、聚类、重排与重建。
OpenAI 研究人员正在测试一种名为"confessions"的方法,训练模型在犯错或行为不当时主动承认,以提升 AI 的诚实性、透明度以及模型输出的可信度。
Google DeepMind 发布研究,科学家借助 AlphaFold 与冷冻电镜结合,解析了“坏胆固醇”低密度脂蛋白(LDL)关键蛋白 apoB100 的结构。
推荐理由:AlphaFold 与冷冻电镜结合解析 apoB100 结构,读者可了解 AI 在结构生物学中的具体协作方式。
Google Research 提出一种轻量线性回归模型,预测未来若干分钟后 EV 充电端口可用的概率,以缓解续航焦虑。该模型以一天中各小时为特征、学习各时段占用变化权重,在 30 至 60 分钟预测区间上优于"保持当前状态"基线,主要靠识别高占用周转时刻取胜。评估覆盖 CA 和德国两地 100 个随机站点、每日采样 48 次、持续一周。
Hugging Face 的 Open ASR Leaderboard 新增多语言和长音频转录赛道,截至 2025 年 11 月 21 日已对比来自 18 个机构的 60+ 个开源与闭源模型、覆盖 11 个数据集。
OpenAI 公布首批研究案例,展示 GPT-5 在数学、物理、生物学和计算机科学领域加速科学进展。这些实验呈现 AI 与研究人员如何协作生成证明、发现新见解,并改变科学发现的速度。
Google Research 介绍了一种端到端语音到语音翻译(S2ST)模型,直接生成译文音频并保留原说话人音色,延迟仅 2 秒,而现有级联系统通常有 4-5 秒延迟且会累积误差。
推荐理由:Google 端到端语音翻译把延迟从 4-5 秒压到 2 秒并保留原说话人音色,可对照级联方案理解取舍。
ServiceNow 的 SLAM Lab 将 15B 推理模型改造成 Mamba 混合架构,旗舰 Apriel-H1-15b-Thinker-SFT 在吞吐提升 2.1 倍的同时推理质量基本持平,MATH500 从 0.90 升至 0.92、MTBench 从 8.30 升至 8.58,GSM8k、GPQA、AIME24 略有下降。
OpenAI 发布 GPT-5.1-Codex-Max 系统卡,说明为该模型部署的安全措施。系统卡涵盖模型层缓解手段,包括针对有害任务和提示注入的专门安全训练,以及产品层缓解手段,如智能体沙箱和可配置网络访问。
推荐理由:系统卡披露了 GPT-5.1-Codex-Max 在模型层与产品层采取的安全措施,可了解其针对提示注入与智能体沙箱的防护思路。
Google DeepMind 联合 Google Research 发布 "Natural Forests of the World 2020" 地图与数据集,这是首个全球一致、10 米分辨率、能区分天然林与其他树木覆盖的地图,在独立全球数据集上验证准确率达 92.2%。
OpenAI 正在探索机制可解释性,以理解神经网络的推理过程。其提出的稀疏模型方法有望让 AI 系统更透明,并支持更安全、更可靠的行为。
Google Quantum AI 与 Stanford、MIT、Caltech 合作在 Nature 发表论文,提出量子算法 Decoded Quantum Interferometry(DQI),利用量子干涉把优化问题转化为解码问题求解。
推荐理由:Google Quantum AI 提出把优化问题转成解码问题的量子算法,并给出相对经典算法的运算量对比。
Google DeepMind 在 Nature 发表新论文,分析 AI 视觉模型与人类在视觉表征组织上的差异,并提出一种三步对齐方法。该方法先用 THINGS 数据集训练一个冻结主模型的小适配器作为教师模型,再生成包含百万张图像、数百万条类人判断的 AligNet 数据集,最后微调其他学生模型。
Google Research 在 NeurIPS 2025 论文《Nested Learning: The Illusion of Deep Learning Architectures》中提出 Nested Learning,把模型架构与优化算法视为同一套相互嵌套、并行优化的多层级学习问题,以缓解持续学习中的灾难性遗忘。
Google 推出数据科学智能体 DS-STAR,通过数据文件分析、LLM 评判验证和顺序规划迭代三项创新,在 DABStep、KramaBench、DA-Code 三个基准上超越 AutoGen 和 DA-Agent,准确率分别从 41.0% 提升至 45.2%、39.8% 提升至 44.7%、37.0% 提升至 38.5%,并登顶 DABStep 公开排行榜。
Google 发布森林砍伐风险预测基准数据集,基于纯卫星输入和 vision transformer 架构,可在 30 米尺度上预测砍伐风险。Google 同时用结合 AlphaEarth Foundations 卫星嵌入向量的 GNN 模型绘制物种分布图,并通过 UN Biodiversity Lab 和 Earth Engine 发布 23 张物种地图。
Google 发布 ForestCast,用纯卫星数据与视觉 Transformer 预测森林砍伐风险,并公开首个面向该任务的深度学习基准数据集。模型仅输入 Landsat、Sentinel 2 及“变化历史”数据,精度可匹敌或超过依赖道路等专用地图的传统方法,其中变化历史是最关键输入。相关训练与评估数据已开放,供社区复现并构建更优模型。
Google 公布名为 Project Suncatcher 的研究计划,设想由太阳能卫星组成星座、搭载 Google TPU 并通过自由空间光链路互联,相关预印本论文探讨了卫星间高带宽通信、轨道动力学和辐射对计算的影响。
推荐理由:Google 公开了太空 AI 数据中心的系统设计与关键挑战,读者可了解其轨道方案、星间链路和 TPU 抗辐射测试的早期结论。
OpenAI 发布 IndQA,一个用于评估 AI 系统印度语言能力的新基准,由领域专家共建,覆盖 12 种语言和 10 个知识领域,重点考察文化理解与推理能力。
一篇新文章提出用"分治"范式替代时序差分(TD)学习来做 off-policy 强化学习,通过将轨迹对半切分并组合子段价值来更新整体价值,理论上把 Bellman 递归次数从线性降到对数级。作者与 Aditya 合作的工作首次将分治价值学习扩展到目标条件强化学习这类复杂任务,且无需像 n-step TD 那样调节超参数 n。目前该方法仍面临如何选取最优子目标 w 的难题。
Google Research 提出可证明隐私洞察(PPI),结合 LLM、差分隐私(DP)和可信执行环境(TEE),在保证个体数据不可被查看、聚合结果匿名的前提下分析 GenAI 使用数据。