大模型优化器 & 流形优化日报 — 2026年7月1日

大模型优化器 & 流形优化日报 — 2026年7月1日

🔬 大模型优化器 & 流形优化日报

覆盖日期:2026年6月28日 – 7月1日 上期成功报告:2026年6月28日 本期执行:2026年7月1日

⚠️ 说明:上期(7月1日)调度因 agent 超时而失败,本报告为补发。上期成功报告于 6月28日产出,覆盖了 DMuon、HiMuon、Tensorion、MD Decoupling 等大量内容。本期重点围绕 6月28日-7月1日的新投稿。


📌 本期重点

🔥 1. Dead-Direction Conditioners (DDC):规范等变预条件——流形优化与优化器的完美交汇(2606.29176)

维度 详情
论文 2606.29176
提交 2026年6月28日
作者 Tejas Pradeep Shirodkar(单人,69页巨作)
核心问题 深度网络的损失函数对参数具有连续对称性不变性(logit shift、ReLU rescaling、LayerNorm scale、per-head attention rotation)。Adam 的逐坐标预条件会在每个对称轨道上漂移,将轨迹拉出优化所在的商空间。
方案 DDC (Dead-Direction Conditioner):构建规范等变预条件器,将基础优化器提升为 G-等变优化器。条件是优化器状态在 G-不变度量的轨道分解中,确保轨迹停留在商空间上的预条件梯度流。
架构覆盖 四种规范(cross-entropy shift, ReLU/SwiGLU rescaling, LayerNorm/RMSNorm scale, per-head attention rotation with RoPE)
DDCAdam 效果 在语言模型上,DDCAdam 保持验证-训练损失差距 0.67(AdamW 崩溃到 5.88),死方向率在 65 个 layer-by-observable 单元中读到 32 个(AdamW 仅 7 个)
Vision Transformer DDCAdam 从头训练达到更低验证损失 1.71(AdamW 2.12),压缩了 AdamW 保留的空闲前馈容量
DDCMuon 效果 在 Muon 基础上(旋转规范精确组合),DDCMuon 在 depth 24 时 10/11 种子 grok,而普通 Muon 永远达不到
学科范围 cs.LG, math.DG (微分几何), math.OC, stat.ML
意义 这是本期最重要的论文——它不是一篇普通的优化器论文,而是将微分几何的规范理论系统地应用于优化器设计,给出了严格的等变构造。Differential Geometry 被列为 subject 之一,说明这篇论文同时面向流形优化和深度学习优化两个社区。DDC 同时作用于 Adam 和 Muon 两个基础优化器,展现了广泛的适用性。69页的篇幅说明这是一个高度成熟的独立工作。

🔥 2. Muon 在异步流水线并行中展示鲁棒性(2606.30634)

维度 详情
论文 2606.30634
提交 2026年6月29日
作者 Philip Zmushko, Egor Petrov, Nursultan Abdullaev, Mikhail Khrushchev, Samuel Horváth
核心发现 PipeDream-2BW 异步流水线消除了同步实现的空闲气泡,但梯度陈旧(one-step delay)此前被认为根本不稳定。本文挑战这一假设:退化程度取决于优化器选择,而非内在限制。
关键结果 AdamW 在一阶延迟下严重退化,但 Muon 表现出强鲁棒性。引入优化器无关的 Error Feedback 纠错进一步缓解延迟效应。
规模 模型规模达 10B 参数
理论 提供了 Muon 带/不带 Error Feedback 纠错的收敛理论分析
意义 这是 Muon 工程价值的又一力证——不仅训练效率高,还在分布式系统健壮性上胜过 AdamW。与上期的 DMuon(分布式通信优化)形成互补:DMuon 解决同步分布式场景,本工作在异步场景下展示 Muon 的优势。

📊 大模型优化器(仅限此前未覆盖的新内容)

🟢 Muon 在矩阵分解中的动力学分析(2606.30509)

维度 详情
论文 2606.30509
提交 2026年6月29日
作者 Mark Rhee, Jamie Simon, Dhruva Karkada
三大动力学差异 1️⃣ 避免缓慢的 saddle-to-saddle 动力学:Muon 以相同速率学习所有顶部模式,较小模式先收敛。2️⃣ 学习率鲁棒性:即使学习率超过局部损失尖锐度的临界阈值,Muon 仍保持稳定——学习率从问题条件数中解放。3️⃣ 守恒量不同:Muon 流守恒 (U^\top U - V^\top V),梯度流守恒 (U^\top U + V^\top V)。
权重对齐 从随机初始化训练时,权重会在训练早期自发对齐。推导了对齐率的简单公式,并在一般情况下验证。
最优调度 利用 Muon 的结构特性,构造了仅两步优化即可达到近完美对齐的学习率调度。
意义 为 Muon 的理论理解提供了简洁而深刻的 toy model。矩阵分解是最小化学习问题的基准,这里的分析非常干净——三个主要差异清晰揭示了 Muon 和 GD 之间的本质区别。特别地,学习率不受条件数限制这一特性解释了 Muon 在大规模训练中更快的原因。

🟢 Priority-Constrained Descent (PCD):层次化多目标优化(2606.29521)

维度 详情
论文 2606.29521
提交 2026年6月28日
作者 Dara Varam, Mohamed I. Alhajri
核心 现有多目标优化方法存在对称性问题,忽略了目标之间的层次结构。PCD 保留主目标的下山方向,同时允许最小失真以保证在次目标上的进展。
性质 目标缩放不变性;两目标和三目标问题有精确闭式解。
验证 网络压缩、非结构化稀疏性和低秩性实验中展示 Pareto 优势。
意义 与优化器生态有间接关联——当训练涉及多目标(如压缩+精度、稀疏性+精度)时,层次化梯度调整可以无缝叠加到任何基础优化器上。

🟢 Informational Frustration & Entropic Gradient Descent(2606.30512)

维度 详情
论文 2606.30512
提交 2026年6月29日
作者 Srinivasa Rao P., Vangmayi P Reddy
核心 提出熵可学习性视界(ELH)理论:网络只能真正学习数据流形的 Shannon 熵超过目标函数决策边界的拓扑熵的函数。引入Entropic Gradient Descent (EGD),动态管理权重熵以保持学习轨道。
注意 仅8页短文,属于理论/概念性工作。使用”neural manifolds”术语但非传统流形优化。
意义 熵视角的优化器设计有趣但尚处理论阶段,与当前主流的 Muon/AdamW 工程导向形成对比。

🟢 SOAP / Shampoo / AdamW 方向

本期无新增内容。 SOAP 和 Shampoo 家族持续静默。但 DDC 论文与 Shampoo/SOAP 的预条件思路有精神上的亲缘性——DDC 是规范等变预条件,Shampoo 是 Kronecker 预条件。


🔄 流形优化(仅限此前未覆盖的新内容)

🟢 本期亮点:DDC 是流形优化 × 深度学习的实质性进展

不同于上期「流形优化无新增论文」的静默状态,本期 DDC (Dead-Direction Conditioners) 直接使用了微分几何的工具(规范理论、商空间、轨道分解、G-不变度量)来设计优化器,并以 math.DG (Differential Geometry) 作为 subjects 之一。

传统流形优化 DDC 的几何视角
在预定义流形(如 Grassmannian、Stiefel)上优化 从网络对称性自动导出商空间流形结构
需要显式retraction/投影 通过规范等变预条件隐式保持轨迹在商空间上
通常针对特定层类型 覆盖4类架构规范,通用性强
优化器与几何分离 将几何直接融入优化器构造

这是本期最值得关注的流形优化与深度学习交叉的前沿进展。

🟢 其他方向

  • Fisher-Geometric Sharpness (2606.20469, 6月18日):上期已提到,本期无跟进。
  • Lie-Algebra Attention (2606.20547):上期已提到,本期无新进展。
  • Neural Manifolds (信息论):2606.30512 使用”流形”语言但更偏信息论/统计力学(Shannon 瓶颈、拓扑熵),非传统 Riemannian 优化。保留在 📊 部分报道。
  • 传统的 Riemannian SGD、Riemannian Adam 方向:本期无新增内容。

趋势观察:流形优化的研究正从两个方向被吸收进优化器设计——(1)DDC 直接将微分几何工具嵌入优化器构造;(2)Muon 社区(MD Decoupling 的超球面分解、AngularMuown 的黎曼步、Tensorion 的张量范数球)继续借用几何语言。纯粹以”流形优化”名义发表的新工作减少,但几何思想在主流优化器中的渗透加速。


💡 讨论与趋势

1. 「规范等变优化」—— 一个新范式的诞生?

DDC 是本期最重要的方法论贡献。它的核心洞察是:深度网络的对称性是优化器应该利用的免费结构信息,而不是忽视的冗余。69页的篇幅、严格的等变证明、跨 Adam/Muon 两个 base 的验证,使其质量非常高。

上期 MD Decoupling 展示了「解耦幅度/方向」在超球面上的几何洞察,本期 DDC 则更进一步,将整个对称群结构纳入优化器。两者在精神上是相通的:权重空间的几何结构应该引导而非被动适应优化器。

2. Muon 的 Dynamics 理解持续深化

从两期前的 River-Valley(Muon 后期收敛慢)、到 AngularMuown(可调角度步长)、再到本期 Muon in Matrix Factorization(三大动力学差异/两步对齐调度)——对 Muon 工作原理的理论理解在半个月内从「黑箱经验」快速走向「可分析的动力学模型」。

本期 2606.30509 尤其简洁优雅:矩阵分解这个最简模型清晰地分离出 Muon 和 GD 的本质差异。

3. Muon 的分布式健壮性——异步流水线的新视角

2606.30634 的发现很重要:AdamW 在异步流水线的一步延迟下严重退化,而 Muon 保持鲁棒。结合上期的 DMuon(同步分布式场景优化),Muon 正在成为分布式训练中更健壮的默认选择

4. 下期关注

  1. DDC 的代码仓库是否公开,以及在大规模 LLM 上的复现
  2. DDCMuon 的 10/11 seeds grok 结果是否引发更多跟进
  3. Muon 在矩阵分解中的两步对齐调度是否能推广到实际 LLM 训练
  4. Muon + 异步流水线是否成为训练基础设施的新标准做法
  5. SOAP/Shampoo 家族何时结束静默期