Dust:不依赖反向传播的 Transformer 预训练

研究团队 qlabs 发布 Dust,一种不依赖反向传播的 Transformer 预训练方法,靠扰动激活值而非权重来估计梯度,在多项设置下逼近甚至超过传统方法,同时比主流进化策略高效约 10^3 到 10^4 倍,为大算力时代探索非梯度训练路线提供了新证据。

一句话看懂:研究团队 qlabs 发布 Dust,一种不依赖反向传播的 Transformer 预训练方法,靠扰动激活值而非权重来估计梯度,在多项设置下逼近甚至超过传统方法,同时比主流进化策略高效约 10^3 到 10^4 倍,为大算力时代探索非梯度训练路线提供了新证据。

事件核心:发生了什么

qlabs 在 Hacker News 上公开了 Dust 的研究。它属于零阶优化方法,核心做法不是像反向传播那样计算一阶梯度,而是对每个 token 的激活值独立施加扰动,再用扰动降低损失的程度作为奖励,加权平均后估计梯度方向。团队提出的“虚拟种群”概念,让一次前向传播就能并行评估所有扰动样本,无需真正把每个种群成员实例化出来。

在实验中,Dust 的梯度估计随种群规模增大而越来越接近反向传播,在多个设置下甚至超过后者。团队还发现,模型越大反而越“种群高效”:一个 243M 参数模型在多数种群规模下表现优于小 120 倍的模型。从 100 万 token 起,Dust 的效率约是基于 EGGROLL 的 Transformer 实现的 10^3 到 10^4 倍。相关结论已测试到 10 亿 token 规模。

为什么重要

反向传播长期是现代神经网络训练的默认路径,架构、优化器和硬件都围绕它演化。Dust 的意义在于,它把“算力换通用性”的思路推到预训练阶段:如果零阶方法能随算力扩张持续逼近甚至超越反向传播,那未来可能不再被可微性和一阶梯度束缚,架构搜索空间会更大。

更现实的一点是,过去业界普遍认为零阶方法难以扩展到大型网络,而 Dust 显示模型越大越种群高效,这对“能不能规模化”这一问题给出了正面信号。它未必立刻替代反向传播,但为训练大模型提供了一条可验证的备选技术路线。

对用户/开发者/创作者的影响

目前公开信息显示,Dust 仍处于研究阶段,没有推出可直接调用的 API、工具链或产品,因此普通用户和创作者短期内不会直接感知变化。对开发者和研究者而言,值得关注的是它可能影响未来训练框架的设计:如果激活扰动真能在大规模预训练中站住脚,模型训练对显存、并行策略和硬件的假设都可能被重新审视。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

从企业采购和算力投入角度看,这条路线当前强调的是“在算力充裕时可能更优”,意味着真正的成本结构尚未明朗,不宜据此调整短期预算。

值得关注的后续

一是 Dust 能否在更大参数规模、更长训练步数上保持梯度对齐,目前公开数据止于 10 亿 token 量级。二是是否有团队复现或将其引入开源训练框架,形成可用工具链。三是它与主流反向传播预训练在同等算力预算下的实际成本对比,这决定它是否只是学术探索还是工程选项。

来源:Hacker News (黑客新闻)

celebrityanime
celebrityanime
文章: 27490

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注