Google 研究者提出 RRSI,防止自我改进智能体记住测试任务
Google 研究者提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),在让语言模型反复改写智能体 harness 的自我优化循环中加入约束,避免智能体记住测试任务。
Google 研究者提出 RRSI(Regularized Recursive Self-Improvement of Agent Harnesses),在让语言模型反复改写智能体 harness 的自我优化循环中加入约束,避免智能体记住测试任务。
美团技术团队在 KDD 2026 分享 8 篇收录论文,覆盖推荐大模型 MTFM、奖励建模框架 CDRRM、智能体搜索基准 LocalSearchBench、跨域 ETA 元泛化框架 UME、自动竞价模型 GRAD、生成式推荐训练系统 MTGenRec 等方向。
美团与北京大学提出 GeoRA,一种为 RLVR 显式对齐更新几何的低秩适配方法,已被 ACL 2026 接收为杰出论文。它先用谱先验与欧氏先验定位 RLVR 偏好的稀疏更新区域,再用 SVD 压缩成低秩适配器并冻结残差锚点,在 1.5B 到 32B 的 Qwen 与 Llama 上于数学、医学、代码任务稳定优于低秩基线。
美团在 MTGR 基础上提出统一推荐基座大模型 MTFM,首次实现外卖多个主要业务的统一精排模型,相关成果已被 KDD 2026 收录。MTFM 通过异构 Tokenizer、动态掩码、混合注意力与 Target Scale-Up 等设计应对规模可扩展性、场景可延展性与架构高效性挑战,外卖多业务订单量提升 2.06%~6.68%,推理成本降低 24%。
TypeSafe AI 的 Jev 模型因直接输出决策与概率而走红,而 NeurIPS 2025 入选论文 ConfTuner 早已探索相似思路。
Meta 超级智能实验室的毕树超宣布,其模型 Muse Spark 1.1 和 1.2 在过去 6 个月内协助数学家攻克概率论、微分方程、群论、优化理论、算术物理学、非结合代数六大领域的开放问题,产出 6 篇论文,其中 5 篇给出悬而未决问题的答案,并推翻了群论中一项 2024 年提出的猜想。
推荐理由:Meta 用网页端对话模型在 6 个月内参与解决 6 个数学开放问题,可观察 AI 辅助科研的实际边界。
Hinton、Bengio等22位学者在剑桥大学CASP平台发布15页报告,讨论AI自主研发引发智能爆炸的风险与应对。报告引用产业数据称,Anthropic内部AI编写代码比例从去年年初的个位数升至2026年5月的80%以上,完全由AI自主完成、人类仅做高级别监督的研发工作比例五个月内从1%升至26%;OpenAI与谷歌内部AI生成代码比例也分别达到80%和75%。
亚马逊与杜克大学的研究提出极端稀疏监督方法,在 OPD 后训练中每条 rollout 仅随机保留一个 token 的梯度信号,学生模型推理能力仍显著提升。研究基于 Qwen3 系列构造 9 组教师—学生配置,并跨代码推理、Llama 系列和 PPO 的 RLVR 验证了该现象。
AIBuildAI 团队发布并开源 PostTrain Agent,一个用于自主后训练大语言模型的递归自我改进(RSI)Agent,代码、知识库与技术报告均已公开。
丘成桐参与的最新论文在致谢中感谢GPT 6 Astra和Claude Pro,称它们帮助探索了部分证明思路和计算。论文宣称证明七维空间28种球面每一种都能配上截面曲率严格为正的度量,补上了从非负曲率到正曲率的关键一步,并附带SageMath验证代码。丘成桐对AI的态度从2023年称AI不可能影响最尖端数学家,逐步转变为主张学生尽早学习使用AI工具。
华为、港中文、港科大的研究员联合推出 LegoFlow,一个把造题、答题、筛选、训练、评测全流程自动化的代码数据工程框架,每个环节封装为插件技能供 Claude Code、Codex 等编码智能体调用。
ServiceNow CoreAI 构建了 AutoSynthData,利用目标模型的失败案例和更强教师的成功案例,自动生成并验证新的训练任务,把模型的能力缺口转化为训练数据。
卡内基梅隆、MIT、纽约大学和斯坦福的研究团队开发的 AI 系统 Ataraxos 在军棋类游戏 Stratego 中以 15 胜 1 负 4 平击败被文章称为史上最强的选手 Pim Niemeijer,训练仅用 16 块 GPU 和数千美元。
何恺明团队提出NAT-ARC,一套不依赖LLM的纯视觉ARC解题方案,用ImageNet上的MAE预训练encoder,再迁移到抽象格子推理。表现最好的单模型为0.6B参数,在ARC-1上取得63.4% pass@2,集成后达70.2%,约为专用LLM方案The ARChitects(8B参数、71.6%)四分之一的参数量。
微软研究院实习生开发了一套端到端机器学习流水线,利用 L1 太阳风观测、AE 与 Dst 指数预报及地质电导率数据,为美国本土 66,935 座变电站生成 30-60 分钟前的局地空间天气风险估计。
Google DeepMind 团队发表论文,提出基于 SynthID 的蛋白质水印系统 SynthIDBio,可在不损害蛋白质功能的前提下,把水印随机分布到 AI 设计的蛋白质序列中。
Google DeepMind 发布 SynthID Bio,将水印技术引入合成生物学,把不可感知的签名直接嵌入生物代码,使水印在数字模型和合成出的实体蛋白质上都能被验证,同时保持其生物功能。
推荐理由:DeepMind 把水印从数字内容延伸到合成生物,公开了方法与代码,可观察生物安全筛查这一新方向。
OpenAI 公布前沿 AI 训练安全案例的早期指南,涵盖技术防护措施、运营实践以及失准事件调查三方面。该指南旨在为前沿模型训练过程中的安全论证提供框架。
NVIDIA 加入由 Google DeepMind、EMBL-EBI 等组成的全球研究联盟,通过 AlphaFold Database 开放 2800 多种病毒的蛋白复合物预测 3D 结构,供任何科学家免费使用。
推荐理由:NVIDIA 联合 Google DeepMind 等开放 2800 多种病毒的蛋白复合物预测结构,读者可了解开放科学在疫情准备中的具体做法。
微软研究院在 Nature 发表逆合成预测框架 RetroChimera,由 Transformer 模型 R-SMILES 2 与 GNN 模型 NeuralLoc 组成,通过学习式集成对两者预测排序。
Google Research 推出 MilleMiglia,一个用 C++ 编写的实例生成器,可为中程物流配送问题生成真实且保护隐私的基准数据,源码与文档已在 GitHub 公开。
Google Research 提出 Retrieve-for-Train 框架,通过离线强化学习发现奖励对齐的查询扇出并编译为监督信号,再蒸馏进一个 53.9M 参数的扩散检索器,实现推理时单次非自回归的查询扇出,无需测试时 CoT 推理 token。
Google Research 提出 ToolGrad,一种“先答案后问题”的工具调用数据集生成范式:先构造真实工具调用链,再反向标注用户提示词,只需一步 LLM 调用。
Google Research 用 UK Biobank 欧洲人群与 Biobank Japan 近 20 万日本人群数据,在 8 项临床指标上评估多基因风险评分(PRS)的跨人群迁移效果。结果显示,目标人群样本达 15k 以上时,专用模型优于混合欧洲数据训练;而遗传相关性高的性状可继续受益于欧洲数据直至 25-40k+ 样本。
Google 与 HHMI Janelia 及剑桥等合作者发布雄性果蝇脑与中枢神经系统的完整连接组图谱,成果发表于 Cell,包含超过 166,000 个神经元和 1.25 亿个突触连接,是迄今神经元数量最多的脑图谱。
推荐理由:Google 与 HHMI Janelia 等合作发布迄今神经元数量最多的脑图谱,读者可了解 AI 在连接组学中的具体用法。
Hugging Face 发布 BenchMIRT,一种在单条提示词层面审计 LLM 基准测试的多维 IRT 方法,可分离同一基准中混杂的不同能力信号。该方法基于 100 个 LLM 在 16 个基准、超 34K 道题上的结果训练,在未被告知基准对应能力的情况下自动恢复出安全与通用推理两个主导维度。分析显示 BBQ、WMDP 等安全基准的得分与通用推理关联更强,单一基准分数可能混合多种信号。
Google Research 提出 MAPL-EMIT,一个基于 Swin-S 视觉 Transformer 的深度学习框架,可从 NASA EMIT 高光谱卫星数据中自动检测、预测增强并定位甲烷羽流,在专家标注羽流上召回率达 84%。团队用 360 万个合成甲烷羽流训练模型,并在地球引擎上开放全球羽流数据库,同时在 Kaggle 发布训练模型与合成数据、在 GitHub 发布推理库。
Voice Arena 与 Hugging Face 合作在 Open ASR Leaderboard 上新增 Monsoon en-IN 与 Monsoon hi-IN 两个评测集,印地语成为该榜单多语言标签页上的首个印度语言。
推荐理由:Open ASR Leaderboard 首次纳入印地语与印度英语评测集,读者可了解多语言语音评测如何按说话人属性拆解误差。
Google Research 在 Google Earth AI 下推出实验性研究能力行星预测引擎(PPE),可依据自然语言查询自主完成地理空间数据发现、特征工程、模型训练与评估,将建模周期从数周缩短至数分钟。
推荐理由:原文给出 PPE 在公共卫生、粮食安全与疫情预测上的量化提升,可据此判断自主地理空间建模的可行边界。
Google 发布自监督基础模型 GlucoFM,采用双流设计分离缓慢血糖趋势与短期波动,并保留时间与缺失信息。在四个队列、七项临床任务共 14 组评估中,其 PR-AUC 平均比最佳 GluFormer 变体高 5.8 个百分点,糖尿病风险与 β 细胞功能障碍评估全部领先。
Multiverse Computing 提出 Quantization-Aware Healing(QAH),把 GPT-OSS 120B 压缩到 60B 参数并量化为 MXFP4 后,在 9 项基准中有 7 项超过该 60B 模型的 bfloat16 版本。
推荐理由:论文给出压缩加量化后从原始模型蒸馏的修复配方,并附 9 项基准对比,可据此判断 4-bit 部署的精度取舍。
Google Research 提出 Biomarker Discovery Framework,一个在人类监督下把候选生物标志物优先级排序组织为迭代研究循环的多智能体系统,结合假设生成、并行统计分析、模型训练、对抗验证与文献推理。
Google Research 提出 Mobility-Embedded POIs(ME-POIs)框架,将匿名化移动性数据与文本描述结合,为地点生成同时编码身份与动态功能的嵌入向量。
Hugging Face 博客发布 ALTK-Evolve 研究,在 AppWorld 的 585 个多步任务上测试八款模型后发现,Agent 记忆不是开关而是需要按模型校准的剂量。
Google Research 提出 PhotoScan,一个可从标准 2D 手机照片估算体脂率、Android-to-Gynoid 脂肪比(A/G)和内脏与皮下脂肪面积比(V/S)的深度学习框架。
Google Research 提出知识画像(knowledge profiling)框架,并发布含 2,150 条 Wikipedia 事实的 WikiProfile 基准,用于区分 LLM 的编码失败与召回失败。
Microsoft Research 发布研究模型 CARE-X,一个统一胸部 X 光视觉语言模型,可同时完成报告生成、结构化预测与病灶定位,并用强化学习 DAPO 在多任务中奖励临床正确性。
Hugging Face 的 ALTK-Evolve 在 AppWorld 上以更少 token 追平或超越 ACE:DeepSeek-V3.2 上 TGC 89.3、每任务 263K token,ACE 为 80.4、634K;gpt-oss-120b 上两者准确率基本持平(56.0 对 54.8),但 ALTK-Evolve 仅需约七分之一成本。
Multiverse Computing 发布论文《Efficient Knowledge Distillation for LLMs: Offline Top-K Logits and a Fused Chunked KL Loss》。
微软研究院发布开源框架 Orchard,核心是 Kubernetes 环境服务 Orchard Env,可复用于软件工程、网页导航和个人助理等任务,并支持在 Codex、OpenClaw、ZeroClaw 等真实部署框架内直接训练智能体。
推荐理由:微软研究院开源了可复用的智能体环境服务与三套训练配方,读者可据此了解小模型在真实任务上的训练路径。