大模型优化器 & 流形优化日报 — 2026年7月1日
大模型优化器 & 流形优化日报 — 2026年7月1日
🔬 大模型优化器 & 流形优化日报
覆盖日期:2026年6月28日 – 7月1日 上期成功报告:2026年6月28日 本期执行:2026年7月1日
⚠️ 说明:上期(7月1日)调度因 agent 超时而失败,本报告为补发。上期成功报告于 6月28日产出,覆盖了 DMuon、HiMuon、Tensorion、MD Decoupling 等大量内容。本期重点围绕 6月28日-7月1日的新投稿。
📌 本期重点
🔥 1. Dead-Direction Conditioners (DDC):规范等变预条件——流形优化与优化器的完美交汇(2606.29176)
| 维度 | 详情 |
|---|---|
| 论文 | 2606.29176 |
| 提交 | 2026年6月28日 |
| 作者 | Tejas Pradeep Shirodkar(单人,69页巨作) |
| 核心问题 | 深度网络的损失函数对参数具有连续对称性不变性(logit shift、ReLU rescaling、LayerNorm scale、per-head attention rotation)。Adam 的逐坐标预条件会在每个对称轨道上漂移,将轨迹拉出优化所在的商空间。 |
| 方案 | DDC (Dead-Direction Conditioner):构建规范等变预条件器,将基础优化器提升为 G-等变优化器。条件是优化器状态在 G-不变度量的轨道分解中,确保轨迹停留在商空间上的预条件梯度流。 |
| 架构覆盖 | 四种规范(cross-entropy shift, ReLU/SwiGLU rescaling, LayerNorm/RMSNorm scale, per-head attention rotation with RoPE) |
| DDCAdam 效果 | 在语言模型上,DDCAdam 保持验证-训练损失差距 0.67(AdamW 崩溃到 5.88),死方向率在 65 个 layer-by-observable 单元中读到 32 个(AdamW 仅 7 个) |
| Vision Transformer | DDCAdam 从头训练达到更低验证损失 1.71(AdamW 2.12),压缩了 AdamW 保留的空闲前馈容量 |
| DDCMuon 效果 | 在 Muon 基础上(旋转规范精确组合),DDCMuon 在 depth 24 时 10/11 种子 grok,而普通 Muon 永远达不到 |
| 学科范围 | cs.LG, math.DG (微分几何), math.OC, stat.ML |
| 意义 | ⭐ 这是本期最重要的论文——它不是一篇普通的优化器论文,而是将微分几何的规范理论系统地应用于优化器设计,给出了严格的等变构造。Differential Geometry 被列为 subject 之一,说明这篇论文同时面向流形优化和深度学习优化两个社区。DDC 同时作用于 Adam 和 Muon 两个基础优化器,展现了广泛的适用性。69页的篇幅说明这是一个高度成熟的独立工作。 |
🔥 2. Muon 在异步流水线并行中展示鲁棒性(2606.30634)
| 维度 | 详情 |
|---|---|
| 论文 | 2606.30634 |
| 提交 | 2026年6月29日 |
| 作者 | Philip Zmushko, Egor Petrov, Nursultan Abdullaev, Mikhail Khrushchev, Samuel Horváth |
| 核心发现 | PipeDream-2BW 异步流水线消除了同步实现的空闲气泡,但梯度陈旧(one-step delay)此前被认为根本不稳定。本文挑战这一假设:退化程度取决于优化器选择,而非内在限制。 |
| 关键结果 | AdamW 在一阶延迟下严重退化,但 Muon 表现出强鲁棒性。引入优化器无关的 Error Feedback 纠错进一步缓解延迟效应。 |
| 规模 | 模型规模达 10B 参数 |
| 理论 | 提供了 Muon 带/不带 Error Feedback 纠错的收敛理论分析 |
| 意义 | 这是 Muon 工程价值的又一力证——不仅训练效率高,还在分布式系统健壮性上胜过 AdamW。与上期的 DMuon(分布式通信优化)形成互补:DMuon 解决同步分布式场景,本工作在异步场景下展示 Muon 的优势。 |
📊 大模型优化器(仅限此前未覆盖的新内容)
🟢 Muon 在矩阵分解中的动力学分析(2606.30509)
| 维度 | 详情 |
|---|---|
| 论文 | 2606.30509 |
| 提交 | 2026年6月29日 |
| 作者 | Mark Rhee, Jamie Simon, Dhruva Karkada |
| 三大动力学差异 | 1️⃣ 避免缓慢的 saddle-to-saddle 动力学:Muon 以相同速率学习所有顶部模式,较小模式先收敛。2️⃣ 学习率鲁棒性:即使学习率超过局部损失尖锐度的临界阈值,Muon 仍保持稳定——学习率从问题条件数中解放。3️⃣ 守恒量不同:Muon 流守恒 (U^\top U - V^\top V),梯度流守恒 (U^\top U + V^\top V)。 |
| 权重对齐 | 从随机初始化训练时,权重会在训练早期自发对齐。推导了对齐率的简单公式,并在一般情况下验证。 |
| 最优调度 | 利用 Muon 的结构特性,构造了仅两步优化即可达到近完美对齐的学习率调度。 |
| 意义 | 为 Muon 的理论理解提供了简洁而深刻的 toy model。矩阵分解是最小化学习问题的基准,这里的分析非常干净——三个主要差异清晰揭示了 Muon 和 GD 之间的本质区别。特别地,学习率不受条件数限制这一特性解释了 Muon 在大规模训练中更快的原因。 |
🟢 Priority-Constrained Descent (PCD):层次化多目标优化(2606.29521)
| 维度 | 详情 |
|---|---|
| 论文 | 2606.29521 |
| 提交 | 2026年6月28日 |
| 作者 | Dara Varam, Mohamed I. Alhajri |
| 核心 | 现有多目标优化方法存在对称性问题,忽略了目标之间的层次结构。PCD 保留主目标的下山方向,同时允许最小失真以保证在次目标上的进展。 |
| 性质 | 目标缩放不变性;两目标和三目标问题有精确闭式解。 |
| 验证 | 网络压缩、非结构化稀疏性和低秩性实验中展示 Pareto 优势。 |
| 意义 | 与优化器生态有间接关联——当训练涉及多目标(如压缩+精度、稀疏性+精度)时,层次化梯度调整可以无缝叠加到任何基础优化器上。 |
🟢 Informational Frustration & Entropic Gradient Descent(2606.30512)
| 维度 | 详情 |
|---|---|
| 论文 | 2606.30512 |
| 提交 | 2026年6月29日 |
| 作者 | Srinivasa Rao P., Vangmayi P Reddy |
| 核心 | 提出熵可学习性视界(ELH)理论:网络只能真正学习数据流形的 Shannon 熵超过目标函数决策边界的拓扑熵的函数。引入Entropic Gradient Descent (EGD),动态管理权重熵以保持学习轨道。 |
| 注意 | 仅8页短文,属于理论/概念性工作。使用”neural manifolds”术语但非传统流形优化。 |
| 意义 | 熵视角的优化器设计有趣但尚处理论阶段,与当前主流的 Muon/AdamW 工程导向形成对比。 |
🟢 SOAP / Shampoo / AdamW 方向
本期无新增内容。 SOAP 和 Shampoo 家族持续静默。但 DDC 论文与 Shampoo/SOAP 的预条件思路有精神上的亲缘性——DDC 是规范等变预条件,Shampoo 是 Kronecker 预条件。
🔄 流形优化(仅限此前未覆盖的新内容)
🟢 本期亮点:DDC 是流形优化 × 深度学习的实质性进展
不同于上期「流形优化无新增论文」的静默状态,本期 DDC (Dead-Direction Conditioners) 直接使用了微分几何的工具(规范理论、商空间、轨道分解、G-不变度量)来设计优化器,并以 math.DG (Differential Geometry) 作为 subjects 之一。
| 传统流形优化 | DDC 的几何视角 |
|---|---|
| 在预定义流形(如 Grassmannian、Stiefel)上优化 | 从网络对称性自动导出商空间流形结构 |
| 需要显式retraction/投影 | 通过规范等变预条件隐式保持轨迹在商空间上 |
| 通常针对特定层类型 | 覆盖4类架构规范,通用性强 |
| 优化器与几何分离 | 将几何直接融入优化器构造 |
这是本期最值得关注的流形优化与深度学习交叉的前沿进展。
🟢 其他方向
- Fisher-Geometric Sharpness (2606.20469, 6月18日):上期已提到,本期无跟进。
- Lie-Algebra Attention (2606.20547):上期已提到,本期无新进展。
- Neural Manifolds (信息论):2606.30512 使用”流形”语言但更偏信息论/统计力学(Shannon 瓶颈、拓扑熵),非传统 Riemannian 优化。保留在 📊 部分报道。
- 传统的 Riemannian SGD、Riemannian Adam 方向:本期无新增内容。
趋势观察:流形优化的研究正从两个方向被吸收进优化器设计——(1)DDC 直接将微分几何工具嵌入优化器构造;(2)Muon 社区(MD Decoupling 的超球面分解、AngularMuown 的黎曼步、Tensorion 的张量范数球)继续借用几何语言。纯粹以”流形优化”名义发表的新工作减少,但几何思想在主流优化器中的渗透加速。
💡 讨论与趋势
1. 「规范等变优化」—— 一个新范式的诞生?
DDC 是本期最重要的方法论贡献。它的核心洞察是:深度网络的对称性是优化器应该利用的免费结构信息,而不是忽视的冗余。69页的篇幅、严格的等变证明、跨 Adam/Muon 两个 base 的验证,使其质量非常高。
上期 MD Decoupling 展示了「解耦幅度/方向」在超球面上的几何洞察,本期 DDC 则更进一步,将整个对称群结构纳入优化器。两者在精神上是相通的:权重空间的几何结构应该引导而非被动适应优化器。
2. Muon 的 Dynamics 理解持续深化
从两期前的 River-Valley(Muon 后期收敛慢)、到 AngularMuown(可调角度步长)、再到本期 Muon in Matrix Factorization(三大动力学差异/两步对齐调度)——对 Muon 工作原理的理论理解在半个月内从「黑箱经验」快速走向「可分析的动力学模型」。
本期 2606.30509 尤其简洁优雅:矩阵分解这个最简模型清晰地分离出 Muon 和 GD 的本质差异。
3. Muon 的分布式健壮性——异步流水线的新视角
2606.30634 的发现很重要:AdamW 在异步流水线的一步延迟下严重退化,而 Muon 保持鲁棒。结合上期的 DMuon(同步分布式场景优化),Muon 正在成为分布式训练中更健壮的默认选择。
4. 下期关注
- DDC 的代码仓库是否公开,以及在大规模 LLM 上的复现
- DDCMuon 的 10/11 seeds grok 结果是否引发更多跟进
- Muon 在矩阵分解中的两步对齐调度是否能推广到实际 LLM 训练
- Muon + 异步流水线是否成为训练基础设施的新标准做法
- SOAP/Shampoo 家族何时结束静默期