OpenAI 研究:推理模型难以控制其思维链,而这正是好事
OpenAI 提出 CoT-Control,发现推理模型难以控制自身的思维链,这反而强化了可监控性作为 AI 安全保障的价值。
OpenAI 提出 CoT-Control,发现推理模型难以控制自身的思维链,这反而强化了可监控性作为 AI 安全保障的价值。
Google Research 提出"贝叶斯教学",通过监督微调让 LLM 模仿贝叶斯助手在航班推荐任务中的预测,从而学会按贝叶斯方式更新对用户偏好的概率估计。实验显示,该方法不仅提升训练任务表现,还能泛化到其他任务;而未经训练的 LLM 表现明显逊于最优贝叶斯助手,且往往在单轮交互后性能就停滞。
一篇新预印本将单负振幅扩展至引力子,GPT-5.2 Pro 参与推导并验证了量子引力中非零的引力子树振幅。
OpenAI 与 Pacific Northwest National Laboratory 联合推出 DraftNEPABench,用于评估 AI 编程智能体如何加速联邦许可审批。该基准显示,NEPA 文件起草时间有望最多缩短 15%,助力基础设施审查现代化。
OpenAI 宣布不再使用 SWE-bench Verified 评测,理由是这一基准正日益受到污染,无法准确衡量前沿编码能力。其分析指出该基准存在测试缺陷和训练数据泄漏问题,并建议改用 SWE-bench Pro。
推荐理由:OpenAI 说明 SWE-bench Verified 存在污染与测试缺陷,并给出替代基准建议,可供关注编码评测的人参考。
OpenAI 公开了其 AI 模型在 First Proof 数学挑战赛中的证明尝试,用于测试模型在专家级问题上的研究级推理能力。
IBM Research 与 UC Berkeley 合作,用 MAST(多智能体系统失败分类法)分析 ITBench 中 310 条 SRE 执行轨迹,覆盖 Gemini-3-Flash、Kimi-K2 和 GPT-OSS-120B 三类模型。
推荐理由:IBM 与 UC Berkeley 用 MAST 分类法拆解 310 条 ITBench 执行轨迹,给出不同模型失败模式的差异与对应工程干预方向。
OpenAI 与 Paradigm 联合推出 EVMbench,用于评估 AI 智能体检测、修补和利用高危智能合约漏洞的能力。该基准聚焦高严重性漏洞场景,覆盖发现、修复与攻击三类任务。
Google Research 提出 MapTrace,一套用 Gemini 2.5 Pro 与 Imagen-4 自动生成地图寻路数据的流水线,并开源 200 万条问答对。
OpenAI 发布的一篇新预印本显示,GPT-5.2 为胶子振幅提出了一个新公式,随后由 OpenAI 与学术合作者完成形式化证明与验证。
推荐理由:材料给出 GPT-5.2 在理论物理中提出新公式并被形式化证明的案例,可观察模型在科研推理上的边界。
Google Research 发布开源原型框架 DialogLab,用于创作、模拟和测试动态的人机群组对话,已在 ACM UIST 2025 展示。该框架将对话的社会设定与时间流程解耦,支持拖拽式场景搭建、human control 实时干预和对话动态可视化验证。
Google DeepMind 于 2025 年 8 月发布的生物声学基础模型 Perch 2.0 主要用鸟类等陆生动物音频训练,却在未接触任何水下音频的情况下,作为嵌入模型在海洋任务迁移学习中表现优异。
Google DeepMind 发布两篇论文,介绍由 Gemini Deep Think 驱动的数学研究智能体 Aletheia 及跨学科研究案例。
推荐理由:DeepMind 公开了 Gemini Deep Think 在数学与理论计算机科学研究中的两篇论文,读者可了解其智能体工作流与分级评估方式。
OpenAI 与 Ginkgo Bioworks 的云端自动化平台结合,构建了一个由 GPT-5 驱动的自主实验室,通过闭环实验将无细胞蛋白合成成本降低 40%。
Google Research 提出 Sequential Attention,用贪心选择机制逐步、自适应地挑选要加入模型的层、模块或特征,并将选择过程直接整合进单次模型训练,避免传统贪心算法带来的数量级训练开销。该方法在多个神经网络基准上取得 SOTA,实现快速单遍贪心选择,同时提升效率与可解释性,可扩展至大规模特征选择。
Google 宣布与 Included Health 合作,待 IRB 批准后启动一项全国性前瞻性随机对照研究,在真实虚拟护理工作流中评估对话 AI 的表现。
推荐理由:Google 与 Included Health 合作开展全国性随机对照研究,读者可了解医疗对话 AI 从模拟走向真实临床的评估路径。
Google Research 发布论文《Towards a Science of Scaling Agent Systems》,对 180 组智能体配置做大规模对照评测,得出首批智能体系统的量化缩放原则,指出“智能体越多越好”常会触顶甚至降低表现。
Google Research 提出 ATLAS(自适应迁移缩放定律),基于 774 次训练运行、10M–8B 参数模型、400+ 语言数据,给出多语言模型的最优模型规模、数据量与语言配比建议。ATLAS 通过跨语言迁移矩阵量化 1400 对语言间的互助与干扰,并给出语言数翻倍时模型规模扩 1.18x、数据扩 1.66x 的规则。该研究将在 ICLR 2026 展示。
Hugging Face 团队推出阿联酋方言评测基准 Alyah(阿拉伯语意为"北极星"),包含 1,173 条由阿联酋母语者手工采集的样本,均为四选一选择题。
Google Research 在 NeurIPS 2025 提出 GIST(Greedy Independent Set Thresholding)算法,用于训练数据子集选择,在多样性与效用之间取得平衡。GIST 在图像分类等任务上超越现有 SOTA 基准,并首次为该多样性-效用权衡提供可证明的近似保证:所选子集价值至少为最优解的一半。
Google Research 在 EMNLP 2025 发表的论文提出一种分解式方法,让小型多模态 LLM 在设备端理解用户意图:先逐屏总结每次交互,再从摘要序列中提取意图。该方法在移动端和网页轨迹上均优于 CoT 提示和端到端微调,Gemini 1.5 Flash 8B 的效果可媲美 Gemini 1.5 Pro,成本与速度却大幅占优。
Hugging Face 推出 AssetOpsBench,一个面向工业资产生命周期管理的 AI 智能体评测基准,覆盖 2.3M 传感器遥测点、140+ 场景、4.2K 工单和 53 种结构化故障模式。
微软 unilm 团队发布 Differential Transformer V2(DIFF V2),在保持 KV 头数量不变的前提下把 query 头数翻倍,使解码速度与标准 Transformer 持平,且不再需要自定义注意力 kernel。
推荐理由:微软团队给出 DIFF V2 的代码与消融对比,读者可据此理解差分注意力在解码速度与训练稳定性上的取舍。
Google 研究团队开发了一种基于时序卷积网络(TCN)的多头深度学习模型,仅凭 Pixel Watch 1 的 IMU 信号和用户身高,即可直接估算步速、步长、摆动时间、支撑时间等多项步态指标。在 246 名参与者、约 7 万段步行数据的验证中,手表估算与手机结果无显著差异(p>0.05),多数指标 Pearson r 与 ICC 均超过 0.80。
Google Research 利用 Android Auto 采集的急刹车事件(HBE,减速度超过 -3m/s²)与弗吉尼亚州、加州十年公开碰撞数据,通过负二项回归验证了 HBE 频率与路段碰撞率之间存在统计显著的正相关。
Google Research 在 Science Advances 发表论文,介绍混合模型 NeuralGCM 直接以 2001 至 2018 年 NASA 卫星降水观测训练其机器学习部分,而非依赖再分析数据。
推荐理由:原文给出 NeuralGCM 在降水模拟上的误差下降与极端降水改进,可对照传统参数化方案的局限。
伯克利 AI 研究团队提出一种基于互信息的成像系统评估与优化框架,可直接从带噪测量中估计信息量,无需重建算法或任务专用解码器。该方法在彩色摄影、射电天文、无透镜成像和显微镜四个领域验证,信息估计能预测下游解码性能,优化后的设计达到 SOTA 端到端方法水平,且内存和算力需求更低。相关论文发表于 NeurIPS 2025。
OpenAI 推出针对思维链可监控性的新框架与评估套件,覆盖 24 种环境下的 13 项评估。结果显示,监控模型内部推理远比仅监控输出更有效,为 AI 系统能力提升后的可扩展控制提供了可行路径。
OpenAI 推出 FrontierScience 基准,用于测试 AI 在物理、化学和生物学领域的推理能力,衡量其向真实科学研究迈进的程度。
OpenAI 推出一个真实世界评估框架,用于衡量 AI 加速湿实验室生物研究的能力。该工作使用 GPT-5 优化分子克隆实验方案,同时探讨 AI 辅助实验的潜力与风险。
Google Research 为 STOC 2026 推出实验性 Paper Assistant Tool(PAT),基于 Gemini 2.5 Deep Think 的推理扩展方法,在投稿后 24 小时内为作者提供自动化预审反馈。
推荐理由:Google 官方披露 PAT 在 STOC 2026 的实测反馈数据,可了解 AI 辅助数学证明审阅的实际表现与局限。
Google 在 COLM 2025 论文中提出 Urania 框架,通过差分隐私(DP)聚类与 DP 关键词提取,从 LLM 聊天机器人对话中生成使用洞察,且 LLM 只接触匿名关键词、不接触原始对话。与基于 CLIO 的非隐私基线 Simple-CLIO 相比,其隐私摘要在一项评测中最高有 70% 的概率被 LLM 评估器偏好。隐私预算越紧,主题覆盖度越低,但摘要更简洁聚焦。
Google DeepMind 联合 Kaggle 发布 FACTS Benchmark Suite,在原有 FACTS Grounding 基础上新增 Parametric、Search、Multimodal 三项基准,并将 Grounding 升级至 v2,共 3513 个公开样例,另设私有留出集。
Google Research 发布 Titans 架构与 MIRAS 理论框架,将 RNN 的速度与 Transformer 的精度结合,通过深度神经网络作为长期记忆模块实现测试时记忆。
推荐理由:Google 提出 Titans 架构与 MIRAS 框架,用深度神经网络做长期记忆模块,为超长上下文建模提供新思路。
密歇根州立大学团队借助 AlphaFold 预测植物与嗜热藻类的甘油酸激酶(GLYK)三维结构,发现植物版 GLYK 的三个柔性环在高温下变形失稳。他们用藻类 GLYK 中更刚性的环替换这些不稳定片段,构建的杂合酶中有一个在高达 65 °C 下仍保持稳定,为培育耐热作物提供了路径。
Intel AI Software Group 推出 DeepMath,一个基于 Qwen3-4B Thinking、用 GRPO 微调的数学推理 Agent,通过 smolagents 生成 Python 片段并在沙箱中执行,将结果折回推理过程。
Google Research 在 NeurIPS 2025 发布 Massive Sound Embedding Benchmark(MSEB),用于标准化评测声音嵌入模型的八项核心能力,涵盖检索、推理、分类、转录、分割、聚类、重排与重建。
OpenAI 研究人员正在测试一种名为"confessions"的方法,训练模型在犯错或行为不当时主动承认,以提升 AI 的诚实性、透明度以及模型输出的可信度。
Google DeepMind 的 AlphaFold 团队在发布五周年之际回顾该模型的影响:AlphaFold 2 于 2020 年 CASP 14 上解决蛋白质结构预测难题,2021 年与 EMBL-EBI 合作上线 AlphaFold Protein Database,2022 年放出超过 2 亿个蛋白质结构预测。
Google DeepMind 发布研究,科学家借助 AlphaFold 与冷冻电镜结合,解析了“坏胆固醇”低密度脂蛋白(LDL)关键蛋白 apoB100 的结构。
推荐理由:AlphaFold 与冷冻电镜结合解析 apoB100 结构,读者可了解 AI 在结构生物学中的具体协作方式。