大模型优化器 & 流形优化日报 — 2026年7月13日

大模型优化器 & 流形优化日报 — 2026年7月13日

🔬 大模型优化器 & 流形优化日报

覆盖日期:2026年7月10日 – 7月13日 上期成功报告:2026年7月10日 本期执行:2026年7月13日


📌 本期重点

🔥 1. Aurora:修复 Muon 的「死神经元」问题(2606.27715)

维度 详情
论文 2606.27715
提交 2026年6月26日(首次被本日报覆盖)
作者 Alec Dewulf, Dhruv Pai, Li Yang, Ashley Zhang, Ben Keigwin
核心发现 Muon 在高瘦矩阵(如 MLP 的投影矩阵)上会出现行范数极其不均匀的现象——某些神经元长期接收微小更新,逐渐变成「死神经元」,形成自我强化的负反馈循环
方案 Aurora 在保持极分解几何的前提下,引入额外的行归一化步骤,打破死神经元循环,同时不偏离 Muon 的正交化几何
意义 本期最值得关注的 Muon 改进工作——与 Hyperball(自适应权重衰减)、AngularMuown(分布式优化)并列,填补了「非方矩阵上 Muon 退化」这一空白。Aurora 很可能是 Muon 家族中继 DMuon、Hyperball 之后下一个实用的通用改进

🔥 2. Gradient Smoothing:层间更新平滑——一种通用优化范式(2606.30813)

维度 详情
论文 2606.30813
提交 2026年6月29日(首次被本日报覆盖)
作者 Haoming Meng, Anton Sugolov, Vardan Papyan
核心 观察到 Transformer 这类重复块架构在训练中会产生层间结构化关系。提出 Depth-wise Gradient Augmentation 通用范式——将各层的优化器更新沿深度维度做变换后再应用。实例化 Gradient Smoothing 族,其中最简实现为 Window Smoothing:将相邻层的更新做滑动窗口平均
意义 思路简洁优雅——不需要改变优化器本身,仅对优化器输出做层间耦合处理。可与任何现有优化器(AdamW、Muon 等)叠加使用

📊 大模型优化器(仅限新内容)

🟢 No Subspace to Track:GaLore 的「子空间可追踪性」假说被推翻(2607.05872)

维度 详情
论文 2607.05872
提交 7月7日(未在上期覆盖的早期提交窗口被遗漏)
作者 Noel Thomas(单人)
核心 GaLore 等内存高效优化器的核心假设:梯度主子空间是缓慢漂移的可追踪对象,每 T 步重计算一次子空间即可。本工作在 Pythia-160M 上利用不相交小批量同一训练步计算两个 top-r 子空间估计,发现它们之间的差异(弦距离 0.73√2r)与相隔 T 步的估计差异(0.74√2r)几乎相同——子空间的「表观旋转」主要由估计器噪声主导,而非真实子空间漂移
意义 这是对 GaLore 系列方法(以及所有基于「子空间追踪」的低秩训练方法)的根本性质疑。如果「可追踪子空间」本身不存在,那么这类方法的所有优势都需要重新审视

🟢 Systematic Evaluation of LR Scheduling Strategies(2607.08511)

维度 详情
论文 2607.08511
提交 7月9日
作者 Hafsa Mateen, Radu Timofte, Dmitry Ignatov
核心 在 30 种代表性架构(CNN + Transformer 家族)× 25 种调度器配置上系统评估学习率调度策略。通过自动源码注入在 PyTorch 中应用 9 类调度器
意义 传统 AutoML 通常将调度器视为次要超参——本研究提供了首个大规模、系统性的跨架构 LR 调度器对比基准

🟢 Vanilla SGD + Momentum 在重尾噪声下的收敛性(2607.08104)

维度 详情
论文 2607.08104
提交 7月9日
作者 Ryusei Yamada, Naoki Sato, Hideaki Iiduka
核心 现有重尾噪声下的 SGD 分析几乎都依赖梯度裁剪或归一化。本工作提供了首个不含裁剪/归一化的 vanilla SGD+动量在重尾噪声下的完整收敛性分析
意义 理论贡——说明 LLM 训练中「梯度爆炸」也许并不需要复杂的工程处理,简单动量 SGD 本身就有一定的韧性

🟢 Dynamics of GD with Large Step Size Near a Manifold of Flat Minima(2607.08380)

维度 详情
论文 2607.08380
提交 7月9日
作者 Lachlan Ewen MacDonald, René Vidal
核心 将大步长 GD 的 sharpness 理论从孤立平坦最小值扩展到平坦最小值流形。经典分析要求步长 < 2/λ_max,但实践中常被违反。本工作为过参数化最小二乘中平坦最小值邻域内的大步长 GD 建立了三区域收敛图景
意义 流形视角首次进入 GD 大步长动力学分析——尽管目标不是流形优化本身,但「最小值流形」与黎曼几何的交叉值得关注

🟢 方向汇总

方向 状态
Muon 改进 Aurora 修复高瘦矩阵的行范数退化。Muon 家族继续壮大:Aurora↔Hyperball↔AngularMuown↔DMuon,各攻一个问题
GaLore/低秩训练 No Subspace to Track 从根基上质疑子空间追踪假设
训练稳定性理论 重尾噪声下 SGD + 平坦最小值流形两大理论进展
学习率调度 30×25 大规模 SR 调度基准
**元学习优化器 本期无新增(上期 ELO 进展最大)

趋势观察:本期最大的信号来自 AuroraNo Subspace to Track——前者从正面改进 Muon,后者从反面质疑 GaLore。两篇论文的主题虽截然相反,但共同指向「低秩/矩阵优化器尚远未成熟」,仍有大量理解和工程缺口。


🔄 流形优化(仅限新内容)

🟢 DeepCORD:分布式 Lie 群因子图优化的可学习求解器(2607.08735)

维度 详情
论文 2607.08735
提交 7月9日
作者 Jaeho Shin, Maani Ghaffari, Yulun Tian
核心 并行加速黎曼优化器展开为可微分迭代,学习一个自监督的反馈策略,动态调整求解器参数。目标:一般矩阵 Lie 群上的分布式因子图优化
方向 机器人感知/多机器人 SLAM,但「学习黎曼优化器」的思路与 LLM 训练领域的元学习优化器有深层共鸣——都是在「学习如何优化」
意义 本期流形优化方向最有启发性的工作——突破了传统分布式黎曼优化器的手工调参瓶颈

🟢 AutoAnchor:流形视角下的扩散模型遗忘(2607.08337)

维度 详情
论文 2607.08337
提交 7月9日
作者 Siyuan Wen, Jiahao Zeng, Ningning Ding
核心 将扩散模型遗忘公式化为潜空间中锚点流形上的约束优化问题。用交叉注意力作为流形代理(manifold surrogate),将原本的锚点依赖优化转为几何引导
意义 流形思想向模型安全领域的渗透——虽然不是大模型优化器,但「用流形约束优化替代手工锚点选择」的方法论有借鉴价值

🟢 黎曼优化理论新进展

论文 日期 摘要
Riemannian Proximal Gradient with Inexact Oracle (2606.25764) 6月24日 不精确一阶预言从欧几里得扩展到黎曼优化,证明 RPG-IO 的全局收敛性:搜索方向范数→0、函数值收敛到驻点值
Modified Riemannian Levenberg-Marquardt for Robust Optimization (2606.23560) 6月22日 鲁棒黎曼 LM 处理异常值,块状变体 + Manopt.jl 开源实现,已在测地回归、PINN 等任务上验证

🟢 方向汇总

方向 状态
流形优化 × LLM 交叉 本期无新增直接交叉论文。但 Aurora(Muon 的行归一化)和 GD Flat Minima Manifold(大步长大动力学)本质上都在流形空间中分析优化器行为
可学习黎曼求解器 DeepCORD 开创了「展开可微黎曼优化器 + 自监督参数学习」范式
黎曼优化基础理论 不精确预言 + 鲁棒 LM 两篇补齐了理论拼图
流形视角 x 模型安全 AutoAnchor 开辟了新的交叉方向

趋势观察:本期流形优化与 LLM 训练的直接交叉依然稀疏,但越来越多优化器论文开始使用几何语言——Aurora 的「极分解几何约束」、GD Flat Minima 的「最小值流形」、No Subspace to Track 的「子空间弦距离」都本质上是流形几何概念。「优化器的几何语言化」趋势继续深化。


💡 讨论与趋势

1. 「Muon 家族」进入分叉期

Muon 的改进工作已分裂为多个独立方向:

问题 方案
非方矩阵退化 Aurora(行归一化保持极分解几何)
分布式通信 MatrixFSDP(上期, 零通信 FSDP)+ DMuon(近 Adam 开销)
权重衰减失效 Hyperball(自达标量衰减替代常量衰减)
深层表示保留 Muon as Residual Connection(上上期)

Muon 的「统一理论」尚未形成,但每个具体工程问题都有了针对性的修复。

2. GaLore 的基础假设被挑战

No Subspace to Track 揭示了一个令人不安的事实:GaLore 赖以工作的「子空间可追踪性」可能只是伪象。如果该结论在更大规模(>1B)模型上得到验证,整个低秩训练分支(GaLore、FFT 等)都需要重新审视其理论基础。值得在下期追踪社区反响。

3. LR 调度——被低估的维度

LR 调度常常被优化器社区的注意力掩盖。2607.08511 的系统性实验提醒我们:在模型规模爆炸的时代,调度器的选择可能比优化器架构选择对最终性能的影响更大。30 架构 × 25 调度的覆盖度远超以往任何单一研究。

4. 本期待关注

  1. Aurora 是否开源及在 >1B 模型上的验证
  2. No Subspace to Track 社区的回应和后续验证
  3. Gradient Smoothing 是否有人尝试与 Muon 叠加
  4. DeepCORD 的「可学习黎曼求解器」思路是否向 LLM 训练迁移
  5. 7月13-16日 arXiv 新提交窗口——预计另一个提交高峰