跳到正文
机器之心·· 2 天前AI 评分51

亚马逊与杜克大学研究:万分之一稀疏监督即可提升大模型推理能力

万分之一——大模型后训练中的极端稀疏监督

AI 导读

亚马逊与杜克大学的研究提出极端稀疏监督方法,在 OPD 后训练中每条 rollout 仅随机保留一个 token 的梯度信号,学生模型推理能力仍显著提升。研究基于 Qwen3 系列构造 9 组教师—学生配置,并跨代码推理、Llama 系列和 PPO 的 RLVR 验证了该现象。

来源:机器之心 · mp.weixin.qq.com