亚马逊与杜克大学提出极端稀疏监督后训练方法
热点事件观察中
亚马逊与杜克大学提出极端稀疏监督后训练方法
1 篇报道1 个报道来源1 天前更新
先了解这件事
AI 综述
2026年10月,机器之心报道了亚马逊公司与杜克大学研究团队的一项研究,提出极端稀疏监督的后训练方法。该研究在 OPD 后训练中,对学生模型生成的每一条 rollout 仅随机保留一个 token 处的梯度参与参数更新,同时 mask 掉其他所有 token 处的信号。研究团队基于 Qwen3 系列构造了 9 组不同的教师—学生配置,并将实验拓展到代码推理任务、Llama 系列模型,以及基于 PPO 的 RLVR。报道称,在这种极端稀疏的梯度信号下训练没有失败,反而取得更好的推理性能;万分之一的监督信号仅更新了 10% 的网络参数,即可取得大幅的推理性能提升。目前报道未提及该方法的发布时间、开源情况或适用限制。
AI 根据报道生成 · 3 小时前更新
最新进展10月3日 10:00
亚马逊与杜克大学研究:万分之一稀疏监督即可提升大模型推理能力报道时间线
沿着报道,了解事件的不同侧面。
10月3日
- 机器之心亚马逊与杜克大学研究:万分之一稀疏监督即可提升大模型推理能力
亚马逊与杜克大学的研究提出极端稀疏监督方法,在 OPD 后训练中每条 rollout 仅随机保留一个 token 的梯度信号,学生模型推理能力仍显著提升。研究基于 Qwen3 系列构造 9 组教师—学生配置,并跨代码推理、Llama 系列和 PPO 的 RLVR 验证了该现象。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。