Dust:无需反向传播的Transformer预训练方法
热点事件持续更新
Dust:无需反向传播的Transformer预训练方法
1 篇报道1 个报道来源3 小时前更新
先了解这件事
AI 综述
2026年10月6日,研究团队(qlabs.sh)在Hacker News上提出并发布零阶优化预训练方法 Dust,通过扰动激活值而非权重来预训练 Transformer 语言模型。据该来源称,这是首个在预训练 transformer 语言模型上可与反向传播竞争的方法;Dust 在每个 token 上独立扰动激活,一次前向传播即可并行评估整个虚拟种群,据外推比权重空间 ES 方法 EGGROLL 高效 10^3 到 10^4 倍。该来源同时说明,目前并未尝试让 Dust 在计算效率上足以取代反向传播,在当前算力水平下,Dust 要成为反向传播的实际替代方案还需提升数个数量级的计算效率,这些均留待未来工作。
AI 根据报道生成 · 2 小时前更新
最新进展10月6日 05:15
Dust:不依赖反向传播预训练 Transformer 的零阶方法报道时间线
沿着报道,了解事件的不同侧面。
10月6日
- Hacker NewsDust:不依赖反向传播预训练 Transformer 的零阶方法
研究团队提出 Dust,一种通过扰动激活值而非权重来预训练 Transformer 语言模型的零阶优化方法,是首个在预训练上可与反向传播竞争的方法。Dust 在每个 token 上独立扰动激活,一次前向传播即可并行评估整个虚拟种群,据外推比权重空间 ES 方法 EGGROLL 高效 10^3 到 10^4 倍。
本事件热度走势
还没有足够的连续观测数据,暂不绘制趋势。