🔬 大模型优化器 & 流形优化日报
覆盖日期:2026年7月10日 – 7月13日
上期成功报告:2026年7月10日
本期执行:2026年7月13日
📌 本期重点
🔥 1. Aurora:修复 Muon 的「死神经元」问题(2606.27715)
| 维度 |
详情 |
| 论文 |
2606.27715 |
| 提交 |
2026年6月26日(首次被本日报覆盖) |
| 作者 |
Alec Dewulf, Dhruv Pai, Li Yang, Ashley Zhang, Ben Keigwin |
| 核心发现 |
Muon 在高瘦矩阵(如 MLP 的投影矩阵)上会出现行范数极其不均匀的现象——某些神经元长期接收微小更新,逐渐变成「死神经元」,形成自我强化的负反馈循环 |
| 方案 |
Aurora 在保持极分解几何的前提下,引入额外的行归一化步骤,打破死神经元循环,同时不偏离 Muon 的正交化几何 |
| 意义 |
⭐ 本期最值得关注的 Muon 改进工作——与 Hyperball(自适应权重衰减)、AngularMuown(分布式优化)并列,填补了「非方矩阵上 Muon 退化」这一空白。Aurora 很可能是 Muon 家族中继 DMuon、Hyperball 之后下一个实用的通用改进 |
🔥 2. Gradient Smoothing:层间更新平滑——一种通用优化范式(2606.30813)
| 维度 |
详情 |
| 论文 |
2606.30813 |
| 提交 |
2026年6月29日(首次被本日报覆盖) |
| 作者 |
Haoming Meng, Anton Sugolov, Vardan Papyan |
| 核心 |
观察到 Transformer 这类重复块架构在训练中会产生层间结构化关系。提出 Depth-wise Gradient Augmentation 通用范式——将各层的优化器更新沿深度维度做变换后再应用。实例化 Gradient Smoothing 族,其中最简实现为 Window Smoothing:将相邻层的更新做滑动窗口平均 |
| 意义 |
⭐ 思路简洁优雅——不需要改变优化器本身,仅对优化器输出做层间耦合处理。可与任何现有优化器(AdamW、Muon 等)叠加使用 |
📊 大模型优化器(仅限新内容)
🟢 No Subspace to Track:GaLore 的「子空间可追踪性」假说被推翻(2607.05872)
| 维度 |
详情 |
| 论文 |
2607.05872 |
| 提交 |
7月7日(未在上期覆盖的早期提交窗口被遗漏) |
| 作者 |
Noel Thomas(单人) |
| 核心 |
GaLore 等内存高效优化器的核心假设:梯度主子空间是缓慢漂移的可追踪对象,每 T 步重计算一次子空间即可。本工作在 Pythia-160M 上利用不相交小批量在同一训练步计算两个 top-r 子空间估计,发现它们之间的差异(弦距离 0.73√2r)与相隔 T 步的估计差异(0.74√2r)几乎相同——子空间的「表观旋转」主要由估计器噪声主导,而非真实子空间漂移 |
| 意义 |
这是对 GaLore 系列方法(以及所有基于「子空间追踪」的低秩训练方法)的根本性质疑。如果「可追踪子空间」本身不存在,那么这类方法的所有优势都需要重新审视 |
🟢 Systematic Evaluation of LR Scheduling Strategies(2607.08511)
| 维度 |
详情 |
| 论文 |
2607.08511 |
| 提交 |
7月9日 |
| 作者 |
Hafsa Mateen, Radu Timofte, Dmitry Ignatov |
| 核心 |
在 30 种代表性架构(CNN + Transformer 家族)× 25 种调度器配置上系统评估学习率调度策略。通过自动源码注入在 PyTorch 中应用 9 类调度器 |
| 意义 |
传统 AutoML 通常将调度器视为次要超参——本研究提供了首个大规模、系统性的跨架构 LR 调度器对比基准 |
🟢 Vanilla SGD + Momentum 在重尾噪声下的收敛性(2607.08104)
| 维度 |
详情 |
| 论文 |
2607.08104 |
| 提交 |
7月9日 |
| 作者 |
Ryusei Yamada, Naoki Sato, Hideaki Iiduka |
| 核心 |
现有重尾噪声下的 SGD 分析几乎都依赖梯度裁剪或归一化。本工作提供了首个不含裁剪/归一化的 vanilla SGD+动量在重尾噪声下的完整收敛性分析 |
| 意义 |
理论贡——说明 LLM 训练中「梯度爆炸」也许并不需要复杂的工程处理,简单动量 SGD 本身就有一定的韧性 |
🟢 Dynamics of GD with Large Step Size Near a Manifold of Flat Minima(2607.08380)
| 维度 |
详情 |
| 论文 |
2607.08380 |
| 提交 |
7月9日 |
| 作者 |
Lachlan Ewen MacDonald, René Vidal |
| 核心 |
将大步长 GD 的 sharpness 理论从孤立平坦最小值扩展到平坦最小值流形。经典分析要求步长 < 2/λ_max,但实践中常被违反。本工作为过参数化最小二乘中平坦最小值邻域内的大步长 GD 建立了三区域收敛图景 |
| 意义 |
流形视角首次进入 GD 大步长动力学分析——尽管目标不是流形优化本身,但「最小值流形」与黎曼几何的交叉值得关注 |
🟢 方向汇总
| 方向 |
状态 |
| Muon 改进 |
Aurora 修复高瘦矩阵的行范数退化。Muon 家族继续壮大:Aurora↔Hyperball↔AngularMuown↔DMuon,各攻一个问题 |
| GaLore/低秩训练 |
No Subspace to Track 从根基上质疑子空间追踪假设 |
| 训练稳定性理论 |
重尾噪声下 SGD + 平坦最小值流形两大理论进展 |
| 学习率调度 |
30×25 大规模 SR 调度基准 |
| **元学习优化器 |
本期无新增(上期 ELO 进展最大) |
趋势观察:本期最大的信号来自 Aurora 和 No Subspace to Track——前者从正面改进 Muon,后者从反面质疑 GaLore。两篇论文的主题虽截然相反,但共同指向「低秩/矩阵优化器尚远未成熟」,仍有大量理解和工程缺口。
🔄 流形优化(仅限新内容)
🟢 DeepCORD:分布式 Lie 群因子图优化的可学习求解器(2607.08735)
| 维度 |
详情 |
| 论文 |
2607.08735 |
| 提交 |
7月9日 |
| 作者 |
Jaeho Shin, Maani Ghaffari, Yulun Tian |
| 核心 |
将并行加速黎曼优化器展开为可微分迭代,学习一个自监督的反馈策略,动态调整求解器参数。目标:一般矩阵 Lie 群上的分布式因子图优化 |
| 方向 |
机器人感知/多机器人 SLAM,但「学习黎曼优化器」的思路与 LLM 训练领域的元学习优化器有深层共鸣——都是在「学习如何优化」 |
| 意义 |
⭐ 本期流形优化方向最有启发性的工作——突破了传统分布式黎曼优化器的手工调参瓶颈 |
🟢 AutoAnchor:流形视角下的扩散模型遗忘(2607.08337)
| 维度 |
详情 |
| 论文 |
2607.08337 |
| 提交 |
7月9日 |
| 作者 |
Siyuan Wen, Jiahao Zeng, Ningning Ding |
| 核心 |
将扩散模型遗忘公式化为潜空间中锚点流形上的约束优化问题。用交叉注意力作为流形代理(manifold surrogate),将原本的锚点依赖优化转为几何引导 |
| 意义 |
流形思想向模型安全领域的渗透——虽然不是大模型优化器,但「用流形约束优化替代手工锚点选择」的方法论有借鉴价值 |
🟢 黎曼优化理论新进展
| 论文 |
日期 |
摘要 |
| Riemannian Proximal Gradient with Inexact Oracle (2606.25764) |
6月24日 |
将不精确一阶预言从欧几里得扩展到黎曼优化,证明 RPG-IO 的全局收敛性:搜索方向范数→0、函数值收敛到驻点值 |
| Modified Riemannian Levenberg-Marquardt for Robust Optimization (2606.23560) |
6月22日 |
鲁棒黎曼 LM 处理异常值,块状变体 + Manopt.jl 开源实现,已在测地回归、PINN 等任务上验证 |
🟢 方向汇总
| 方向 |
状态 |
| 流形优化 × LLM 交叉 |
本期无新增直接交叉论文。但 Aurora(Muon 的行归一化)和 GD Flat Minima Manifold(大步长大动力学)本质上都在流形空间中分析优化器行为 |
| 可学习黎曼求解器 |
DeepCORD 开创了「展开可微黎曼优化器 + 自监督参数学习」范式 |
| 黎曼优化基础理论 |
不精确预言 + 鲁棒 LM 两篇补齐了理论拼图 |
| 流形视角 x 模型安全 |
AutoAnchor 开辟了新的交叉方向 |
趋势观察:本期流形优化与 LLM 训练的直接交叉依然稀疏,但越来越多优化器论文开始使用几何语言——Aurora 的「极分解几何约束」、GD Flat Minima 的「最小值流形」、No Subspace to Track 的「子空间弦距离」都本质上是流形几何概念。「优化器的几何语言化」趋势继续深化。
💡 讨论与趋势
1. 「Muon 家族」进入分叉期
Muon 的改进工作已分裂为多个独立方向:
| 问题 |
方案 |
| 非方矩阵退化 |
Aurora(行归一化保持极分解几何) |
| 分布式通信 |
MatrixFSDP(上期, 零通信 FSDP)+ DMuon(近 Adam 开销) |
| 权重衰减失效 |
Hyperball(自达标量衰减替代常量衰减) |
| 深层表示保留 |
Muon as Residual Connection(上上期) |
Muon 的「统一理论」尚未形成,但每个具体工程问题都有了针对性的修复。
2. GaLore 的基础假设被挑战
No Subspace to Track 揭示了一个令人不安的事实:GaLore 赖以工作的「子空间可追踪性」可能只是伪象。如果该结论在更大规模(>1B)模型上得到验证,整个低秩训练分支(GaLore、FFT 等)都需要重新审视其理论基础。值得在下期追踪社区反响。
3. LR 调度——被低估的维度
LR 调度常常被优化器社区的注意力掩盖。2607.08511 的系统性实验提醒我们:在模型规模爆炸的时代,调度器的选择可能比优化器架构选择对最终性能的影响更大。30 架构 × 25 调度的覆盖度远超以往任何单一研究。
4. 本期待关注
- Aurora 是否开源及在 >1B 模型上的验证
- No Subspace to Track 社区的回应和后续验证
- Gradient Smoothing 是否有人尝试与 Muon 叠加
- DeepCORD 的「可学习黎曼求解器」思路是否向 LLM 训练迁移
- 7月13-16日 arXiv 新提交窗口——预计另一个提交高峰