反向传播的替代方案:增强拉格朗日预测编码

Sakana AI 旗下研究博客发布 PC-ALM(增强拉格朗日预测编码),用一种"逐层局部动力学"替代反向传播,在 1000 层残差 MLP 上接近反向传播的训练表现。

一句话看懂:Sakana AI 旗下研究博客发布 PC-ALM(增强拉格朗日预测编码),用一种”逐层局部动力学”替代反向传播,在 1000 层残差 MLP 上接近反向传播的训练表现。

事件核心:发生了什么

发布方为 pub.sakana.ai,方法名为 PC-ALM(Augmented Lagrangian Predictive Coding)。它属于预测编码(Predictive Coding, PC)路线的扩展:标准 PC 在层与层之间采用类似”热扩散”的耦合,而 PC-ALM 为每一层额外引入对偶神经元(即拉格朗日乘子),使每层的局部循环变成一个 PI 反馈控制器。

关键区别在于,反向传播必须严格按”前向—反向—更新权重”三阶段串行执行,权重更新被锁死,早期层神经元必须一直保持激活等待误差信号;PC-ALM 则让每层只与相邻层通信,按时间向前演化,收敛后由整个系统的动力学把监督信号分发到全网。在线性网络的极限情况下,对偶神经元会收敛到与反向传播完全一致的信用信号,但只用局部计算。实验上,该工作在 Fashion-MNIST、CIFAR-10 等简单任务和残差 MLP 上对比 PC 与反向传播,重点测试深而窄的网络,这类结构正是传统 PC 表现较差的区间;推理步数设为 T=2L,1000 层实验即由此设定。

为什么重要

反向传播是当前大模型训练的绝对主流,但它难以解释大脑如何完成多层信用分配:大脑缺少跨全网强制同步时序的机制。PC-ALM 的价值不在于立刻替代反向传播,而在于证明”仅靠局部动力学也能逼近梯度计算”。若这条路走通,直接影响的是训练侧的技术路线,而不只是推理优化。另一个现实意义是硬件:动力学系统仿真在神经形态芯片上比在 GPU 上更便宜,这可能为低功耗训练提供新的方向。

对用户/开发者/创作者的影响

短期内,普通用户和大多数应用开发者不会直接感知变化——PC-ALM 目前仍是研究阶段的方法,验证场景限于小规模数据集和残差 MLP,尚不涉及大模型、开源权重发布或 API 层面的产品。对做训练框架、分布式系统和神经形态硬件的开发者而言,它提供了一个值得跟踪的替代思路:训练不再依赖全局同步的反向通路,可能改变并行策略和通信开销的设计假设。对算力采购方,目前公开信息显示还不足以据此调整预算。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是能否从 Fashion-MNIST、CIFAR-10 扩展到 Transformer 等主流架构和真实规模数据;二是训练速度、显存占用和能耗相比反向传播是否有可量化优势;三是是否有团队在神经形态硬件或开源框架中复现并落地。

来源:pub.sakana.ai

celebrityanime
celebrityanime
文章: 23574

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注