AREX Feed Article
Sakana AI 发布 PC-ALM:不依赖反向传播训练 1,000 层 MLP,称在 MNIST 上接近反向传播
Sakana AI 在 2026 年 9 月 14 日通过和发布训练方法 PC-ALM(Augmented Lagrangian Predictive Coding,增广拉格朗日预测编码)。博客称,PC-ALM 用层局部动力学替代反向传播的前向、后向流程,每一层只与相邻层交换信息,成功训练了深达 1,000 层的残差 MLP;在 MNIST 上,宽度 32 的网络从 10 层加深到 1,000 层,测试准确率与反向传播的差距保持在约 2 个百分点。
同一张对比图里,标准预测编码(predictive coding,PC)的准确率随深度快速下滑,到 1,000 层时只剩约 60%,而 PC-ALM 与反向传播分别停在约 88% 和约 90% 附近。博客标注的实验设置为残差 MLP、宽度 32、ReLU 激活、MNIST 训练 5 个 epoch;每次权重更新前要运行 T 步推理,T 取网络深度的两倍,1,000 层时相当于每批数据 2,000 步。
每层加一个拉格朗日乘子,把预测误差累积成对偶信号
博客从反向传播的「相锁定」(phase locking)讲起:反向传播严格按前向、后向、更新权重三个阶段顺序执行,早层神经元必须保持激活、等待误差信号到达,而博客认为大脑中没有已知机制能维持这种全局的时序协同。预测编码的做法是让每层只向上传递自己没能预测的部分,即预测误差;整个网络由此可以写成一个带层间约束的优化问题,推理时每层只需要和上下相邻层通信,权重更新则把突触后误差与突触前活动相乘,接近 Hebbian 式的 delta 规则。
标准 PC 的瓶颈是信号衰减:监督信号从输出层进入,要穿过一连串局部妥协才能影响早层,在又深又窄的网络里,信用信号(credit)还没到达输入附近就衰减殆尽。博客说这一现象在预测编码文献中已有记录,并给出一个参照:PC 在层宽 512 的 128 层残差 MLP 上可以工作,但只要网络宽度小于深度,性能就会明显退化。
PC-ALM 的改动是给每层附加一个与激活同维度的拉格朗日乘子(博客称之为「对偶神经元」)。在 PC 的二次罚项之外加入乘子项后,每层的局部循环变成一个 PI 反馈控制器:当前预测误差是比例项,累积的乘子是积分项。推理循环每一步做一次激活下降和一次乘子上升(λ ← λ + α·r,r 为该层预测误差),循环结束后再更新权重;α 取 0 时方法退回标准 PC。
证明,在线性网络中,满足稳定性条件(迭代矩阵谱半径小于 1)时,这套原-对偶迭代会收敛到约束优化问题的 KKT 点:激活回到前向传播时的取值,乘子恰好等于反向传播的伴随梯度,权重更新因此等于精确的 BP 梯度,而整个计算只用到层局部更新。逐模式的稳定性条件是 η_h σ_i²(2ρ+α) < 4,取 ρ=1 时大致对应活动步长 0.5、对偶步长 2 的上限。非线性网络没有相应的证明,作者把它留作实验结论。
数据:MLP 上与反向传播的差距收窄,CIFAR-10 上仍落后约 16 个百分点
博客给出的跨数据集对照中,MNIST 与 Fashion-MNIST 使用宽度 32、训练 1 个 epoch 的残差 MLP:MNIST 上 32、64、128 层的测试准确率,PC-ALM 为 84.96%、82.09%、78.91%,反向传播为 86.48%、84.49%、80.84%,标准 PC 只有 63.21%、50.26%、42.55%;Fashion-MNIST 的 128 层一组为 PC-ALM 73.64%、反向传播 74.70%、PC 53.20%。层数越深,标准 PC 掉得越快。论文在宽度-深度网格上还比较了推理预算:T=L 时 PC-ALM 只能追回一部分差距,T=2L 才完全追平。
换成卷积网络和更难的图像分类任务,差距重新拉开:ResNet-18 在 CIFAR-10 上,反向传播 90.44%、PC-ALM 74.18%、标准 PC 55.93%;Tiny ImageNet 上 ResNet-18 的 Top-1 准确率为反向传播 44.93%、PC-ALM 19.72%、PC 12.00%,Top-5 为 64.78%、43.36%、31.00%。博客的结论是 PC-ALM 在每一项任务上都优于标准 PC;但 CIFAR-10 上它与反向传播相差约 16 个百分点,Tiny ImageNet Top-1 上相差约 25 个百分点。
论文还给出两点量化信息:PC-ALM 的激活内存开销是 PC 的两倍,额外计算量不大;在达到与 BP 的 0.9 梯度余弦相似度这一指标时,PC-ALM 比单纯加宽 PC 的效率高一个数量级。博客把 PC-ALM 的信用传输称为「弹道式」,以区别于 PC 的扩散式传播:监督信号形成的波前更快推进到靠前的层,并在网络中分布得更均匀。论文还观察到,默认 α=1 时梯度对齐会在推理步数约为网络深度两倍处出现一次明显跃升,这个位置可以按 t ≈ L/√(α η_h) 预测。
论文写下的边界:线性证明、单轮训练与随深度增长的推理预算
论文附录 G 列出三条限制。收敛性证明与信用波前分析只覆盖恒等激活、无偏置的网络;实验虽然跑遍 identity、tanh、ReLU 几种激活,但这类情形的收敛保证仍是公开问题,作者注明这与预测编码文献的通行做法一致:理论用线性网络,实验用非线性网络。
实验范围限于 MNIST 与 Fashion-MNIST 的残差 MLP、训练 1 个 epoch,更大的数据集、更长的训练以及卷积、注意力架构都留给未来工作;论文使用的宽度、深度网格各覆盖 8、16、32、64、128 五档,但相对生产规模的网络仍然很小。
第三条限制关系到如何解读这些结果:权重更新与 BP 梯度的对应只在平衡点成立。推理预算有限时可能到不了平衡,梯度会出现错位,而要接近平衡所需的推理预算随网络深度增长。
论文还在附录里提醒,PC-ALM 只回应了反向传播「生物上难以实现」的一部分问题:能量梯度仍然要用到层权重的转置,weight transport(权重传输)问题没有解决。博客写明这项工作的动机是理解大脑这类分布式系统如何在没有反向传播的情况下计算梯度,目标并非取代反向传播;作者提到的一个可能应用方向是神经形态硬件,在那里模拟动力学比在 GPU 上更便宜。
论文 5 月已上传,这次公告带来 1,000 层结果
论文 v1 于 5 月 29 日上传 arXiv,共 22 页、10 张图,实验最深到 128 层,数据集只有 MNIST 与 Fashion-MNIST;页面显示创建于 6 月 12 日,采用 MIT 许可,是配套的 JAX 参考实现。9 月 14 日的博客补上了两项论文 v1 里没有的内容:1,000 层 MNIST 实验,以及 CIFAR-10、Tiny ImageNet 的对照表。
据 X 平台接口数据,截至核查时(北京时间 9 月 16 日凌晨),这条帖文有 288,616 次浏览、2,463 个点赞和 319 次转发。同一天出现在 Hacker News 的提交标题为「Backprop Alternative: Augmented Lagrangian Predictive Coding」,评论里对「替代」二字的理解有分歧:用户 cs702 指出 CIFAR-10 上约 74% 的准确率与反向传播差距仍大,怀疑它算不上反向传播的替代方案;用户 qarl 则回应说,作者已经写明取代反向传播不是目标,他们要回答的是不能做反向传播的分布式系统如何学习。
复现入口与尚未验证的规模
仓库 README 给了一个可复现的实验单元:Fashion-MNIST、宽度 32、深度 32、ReLU、单种子、1 个 epoch、推理预算 T=2L。CPU 参考结果是 BP 78.66%、PC 68.13%、PC-ALM 77.75%;PC-ALM 的权重梯度与 BP 的余弦相似度为 0.909,PC 为 0.604。仓库同时提供覆盖全部宽度、深度组合(各取 8、16、32、64、128)的脚本,以及论文冻结的活动步长表。
上述数字都来自作者自己的实验设置。论文把更大网络与更难任务列为未来工作,因此「接近反向传播」目前只在 MNIST、Fashion-MNIST 这类小规模任务与深窄残差 MLP 的实验中成立;能否在更大规模上复现,仍待验证。