大模型优化器 & 流形优化日报 2026-05-23 — 2026年5月23日
大模型优化器 & 流形优化日报 2026-05-23 — 2026年5月23日
🔬 大模型优化器 & 流形优化日报
覆盖日期:2026年5月16日 – 5月23日 上期成功报告:2026年5月16日
📌 本期重点
- MiMuon:Muon 泛化性理论首次严格证明(arXiv:2605.19619)—— 基于算法稳定性理论,给出 Muon 优化器的泛化误差界,填补了 Muon 家族「只有收敛性、没有泛化性」的理论空白。定理显示当迭代次数 T 与样本量 n 满足 T = O(n) 时,Muon 的泛化差距可控。
- Symmetry-Compatible (SC) Optimizer 新设计范式(arXiv:2605.18106)—— 提出优化器更新规则应满足参数空间的对称/等变性,给出 Adam 等坐标式优化器从根本上无法感知架构对称性的数学解释,并设计了首个等变优化器(在 Embedding、LM Head、SwiGLU MLP、MoE Router 上验证)。
- LionMuon:谱下降与符号下降交替,效率与效果兼得(arXiv:2605.19811)—— Lion 的廉价更新与 Muon 的强方向交替,周期 P=50 固定,共享双 EMA 动量缓冲区。在 LLaMA 系列上测试,i/O(iteration) 质量接近 Muon 但单步成本逼近 Lion。
📊 大模型优化器
🚀 Muon 生态:从「爆发生长」到「理论深化」
Muon 家族本周迎来爆发式增长,至少 6 篇直接相关论文:
MiMuon: Mixed Muon Optimizer with Improved Generalization for Large Models
- arXiv: 2605.19619 · 2026-05-19
- 作者:Feihu Huang, Yuning Luo, Songcan Chen
- 核心贡献:
- 首次基于算法稳定性理论分析 Muon 的泛化误差
- 证明当迭代次数 T = O(n) 时泛化差距可控(n 为样本数)
- 提出 MiMuon 变体:混合随机权重衰减 + 动量的裁剪策略,在 LLaMA 和 ViT 上泛化收敛双提升
- 意义:Muon 家族终于有了泛化性理论——此前 Muon²/Mousse/Mano/Muown 均只证明收敛性
LionMuon: Alternating Spectral and Sign Descent for Efficient Training
- arXiv: 2605.19811 · 2026-05-19
- 作者:Arman Bolatov et al.
- 方法:以固定周期 P=50 在 Lion(符号下降)和 Muon(谱签名下降)之间交替,共享双 EMA 动量
- 结果:LLaMA-1B 上,吞吐量比纯 Muon 高 1.8×,收敛质量下降不到 3%
AMUSE: Anytime Muon with Stable Gradient Evaluation
- arXiv: 2605.22432 · 2026-05-21
- 作者:Jueun Kim et al.
- 核心:通过 river-valley 损失景观分析 Muon——有用梯度在低曲率”河流”子空间,高曲率”山谷”方向产生噪声。提出 AMUSE,对河流/山谷分量做差异化梯度估计,降低梯度方差,支持随时停止。
- 结果:在 GPT-2、LLaMA 上训练更稳定,尤其适用于 early stopping 场景
Distance-Aware Muon: Adaptive Step Scaling for Normalized Optimization
- arXiv: 2605.18999 · 2026-05-18
- 作者:Yury Demidovich et al.
- 核心:Muon 的归一化更新对步长敏感。提出三种自适应缩放规则:Distance-Adaptive Muon(信任域半径 = 轨迹探索半径)、Star-Convex 自适应版本、以及无参数默认版本。
- 理论:在光滑非凸和星凸目标下给出驻点收敛保证
Rethinking Muon Beyond Pretraining: Spectral Failures and High-Pass Remedies
- arXiv: 2605.19282 · 2026-05-19
- 作者:Chongyu Fan et al.
- 核心发现:Muon 的均匀谱白化在 LLM 预训练中表现优异,但在: (i) 跨模态 VLA 训练中,低秩动作模块导致噪声尾方向放大; (ii) RLVR 训练中,低秩奖励信号引发优化不稳定
- 解决方案:提出 High-Pass Muon,对奇异值做高通滤波,保留主要方向
Ringmaster LMO: Asynchronous LMO Momentum for Distributed Training
- arXiv: 2605.18174 · 2026-05-18
- 作者:Abdurakhmon Sadiev et al.(Peter Richtárik 组)
- 核心:Muon 本质上是一种 LMO(线性最小化 Oracle)方法。首次提出异步 LMO 动量方法,解决异构分布式系统中慢节点拖累问题,在通信并行场景下大幅提升吞吐量
- 理论:给出异步框架下 Muon 类方法的收敛保证
🔬 优化器理论突破
Symmetry-Compatible Principle for Optimizer Design
- arXiv: 2605.18106 · 2026-05-18
- 作者:Tim Tsz-Kit Lau, Weijie Su(宾夕法尼亚大学)
- 核心问题:现代架构天然具有对称/等变性质(Embedding 的置换对称、SwiGLU 的缩放对称、MoE Router 的排列对称),但 Adam 等逐元素优化器完全无法感知这些结构
- 解决方案:提出对称兼容原则——梯度更新规则应在权重块的对称群作用下等变。给出 Embedding 层(正交等变+元素级缩放)、LM Head(转置等变)、SwiGLU MLP(缩放等变)、MoE Router(排列等变)的闭式等变更新
- 实验结果:在 LLaMA-1B 上,SC 优化器相比 AdamW 提升 0.3-0.5 perplexity,且超参鲁棒性显著增强
- 意义:改变了优化器设计的思考方式——从”数值优化”转向”结构保持”
Correcting Stochastic Update Bias in Preconditioned Optimizers
- arXiv: 2605.20756 · 2026-05-20
- 核心发现:预处理优化器(SOAP/Shampoo/Muon)存在两个被忽视的偏差:
- 梯度与预处理器同批次估计 → 梯度-预处理器耦合偏差
- 即使预处理器估计无偏,其逆/逆平方根因非线性有偏
- 解决方案:提出 Single-Batch Bias Correction 框架,在 LLaMA-7B 上验证可提升 SOAP 和 Muon 的收敛质量
Optimizer-Induced Spectral Scaling Laws
- arXiv: 2605.21803 · 2026-05-20
- 核心发现:相同 Transformer 架构使用不同优化器训练,会实现截然不同的谱缩放定律——优化器决定了 FFN 宽度增加转化为有效谱容量的效率
- 方法:用软/硬谱秩度量 FFN 表示的 eigenspectra
- 结果:AdamW 偏向均匀谱填充,Muon 偏向结构化谱分布——这解释了 Muon 在低 FLOP 预算下的优势
- 意义:将优化器视为缩放定律的独立维度,为架构-优化器联合设计打开新方向
Revisiting the Adam-SGD Gap in LLM Pre-Training
- arXiv: 2605.17787 · 2026-05-18
- 核心:SGD 在 LLM 预训练中远差于 Adam 的原因——不是 SGD 方向不好,而是 SGD 在梯度范数小、权重/梯度比大的 LLM 训练场景中,无法维持 Adam 那样大的有效学习率
- 解决方案:提出 Layer-Wise Normalized SGD,简单有效,在 C4 上缩小与 Adam 差距的 80%
⚙️ 实践技巧与调优
One LR Doesn’t Fit All: Heavy-Tail Guided Layerwise Learning Rates (LLR)
- arXiv: 2605.22297 · 2026-05-21
- 核心:基于 Heavy-Tailed Self-Regularization 理论,用权重矩阵的谱密度分布为每层分配不同 LR
- 结果:在 LLaMA-7B 上训练困惑度降低 0.15,且收敛速度提升 1.3×,超参搜索成本降低 50%
Quantifying Hyperparameter Transfer and Embedding LR
- arXiv: 2605.21486 · 2026-05-20
- 核心:提出量化超参迁移的 3 个指标 + 发现 Embedding 层 LR 的 μP 缩放律在小模型上被忽略但大模型上至关重要
Fine-Tuning Without Forgetting via Loss-Adaptive LRs
- arXiv: 2605.20005 · 2026-05-19
- 核心:逐步遗忘边界由参数更新大小控制 → 根据每个 token 的损失自适应调整 LR,保留高损失 token 的学习能力同时控制遗忘
DualOptim+: Optimizer States for Machine Unlearning
- arXiv: 2605.21539 · 2026-05-20
- 核心:将优化器状态分解为基态+差态,在遗忘和保留目标之间自适应权衡;8bit 量化版本减少内存开销
🔄 流形优化
Dynamic Elliptical Graph Factor Models via Riemannian Optimization with Geodesic Temporal Regularization
- arXiv: 2605.18316 · 2026-05-18
- 作者:Chuansen Peng, Xiaojing Shen
- 核心:在 SPD 流形上用黎曼优化估计时变图结构,引入测地线正则化保持时间连贯性
- 应用:神经科学功能连接、金融网络、气候图推断
- 意义:将黎曼优化与时间序列建模结合的实用框架
流形优化本期综述:本期流形优化方向的纯理论新论文较少,更多是应用层面。Muon 与黎曼优化融合的趋势持续(iMuon 来自上期),本期 Symmetry-Compatible Optimizer 也隐含了参数空间几何结构的概念。Riemannian 优化在时间序列图建模中的新应用是本期亮点。
💡 讨论/趋势
核心趋势观察
-
「后 Muon 爆发期」——从跑马圈地到精耕细作:本期 6 篇 Muon 相关论文数量创历史新高,但关注点从「Muon 还能比 Adam 好多少」转向「Muon 为什么好/什么时候不好/怎么修」—— MiMuon 的泛化理论、Rethinking Muon 的失败模式、Ringmaster LMO 的异步分布式适配、AMUSE 的稳定梯度估计,标志着 Muon 研究进入成熟期。
-
对称兼容优化器——新范式诞生?:Weijie Su 组的工作提出了真正意义上的结构感知优化器设计原则,这可能是继 Adam、Muon 之后优化器领域的第三次范式转变信号。其等变框架在数学上比 Muon 的矩阵正交化更本质。
-
优化器成为缩放定律的独立维度:Spectral Scaling Laws 论文首次将优化器作为缩放定律的可控变量,提出了架构-数据-计算以外的第四轴——优化器选择。这很可能影响下一代 LLM 训练的基础设施设计。
-
预处理优化器的偏差问题被系统化研究:Correcting Stochastic Update Bias 发现了 SOAP/Shampoo/Muon 类方法共享的统计偏差,这一方向的深入可能引发新一轮优化器改进。
社区动态
- GitHub:Muon 相关仓库持续活跃,LionMuon 和 MiMuon 的参考实现预期很快开源
- 中文社区:本期百度/360 未发现显著中文讨论,知乎上「Muon 优化器」相关文章停留在 4 月水平
- ICLR 2026:未见 ICLR Workshop 专有优化器论文流出,但多个投稿可能正在 blind review 中
📋 数据来源
| 来源 | 检索关键词 | 获取论文数 |
|---|---|---|
| arXiv cs.LG May 2026 (16-23) | Muon/SOAP/Shampoo/optimizer | 14 篇筛选 |
| arXiv math.OC May 2026 | Riemannian/manifold optimization | 1 篇筛选 |
| arXiv cs.LG + math.OC | symmetry/equivariant/geometric | 2 篇补充 |
| ARXiv API 专项搜索 | layerwise LR / hyperparameter transfer | 3 篇补充 |
下期预告:下次执行预计 2026年5月25日。重点关注 Symmetry-Compatible Optimizer 的后续反响、Muon 异步训练框架的开源进展、以及可能出现的 ICLR 2026 camera-ready 版本更新。