大模型优化器 & 流形优化日报 — 2026年6月25日

大模型优化器 & 流形优化日报 — 2026年6月25日

🔬 大模型优化器 & 流形优化日报

覆盖日期:2026年6月22日 – 6月25日 上期成功报告:2026年6月22日 本期执行:2026年6月25日 08:00


📌 本期重点

🔥 1. AngularMuown:将隐式角度步长衰减显式化,已在 nanoGPT 竞速赛领先(2606.23637)

提交日期:6月22日

维度 详情
论文 2606.23637
作者 Florian Hübler, Kai Lion, Antonio Orvieto, Niao He(ETH Zürich)
核心洞察 Muown 将权重矩阵分解为行幅度未归一化的方向变量,方向变量用 Muon 更新。本文证明方向更新等价于归一化方向上的黎曼步,而幅度参数仅调制角度步长
方法 AngularMuown:解耦角度步长与径向幅度更新,直接优化归一化方向,使用可调度的角度乘子
结果 AngularMuown 在 modded nanoGPT speedrunning 竞赛的 per-optimizer 类别中领先;Qwen2-0.5B 和 1.1B MoE 上均超越原始 Muown
代码 已开源:github.com/fhueb/angular-muown
意义 这是对前几期「Muon 的谱控制」讨论的直接工程化落地——将隐式的几何特性显式建模为可调超参数,实现了更好的可调度性和迁移性

与上期衔接:上期 CacheMuon 利用时间冗余,本期 AngularMuown 将隐式几何参数显式化。两者正交,可以叠加。

🔥 2. River-Valley 视角:Muon 为何在最终阶段收敛慢——提出 Muon→GD 两阶段策略(2606.21514)

提交日期:6月19日

维度 详情
论文 2606.21514
作者 Tianqi Shen, Jinji Yang, Runze Shi, Jianhao Ma, Jiaye Teng
核心发现 提出河流-山谷(river-valley)视角:景观由流向解的河流方向和编码噪声的山丘方向组成。Muon 在早期沿河流方向移动更快,但在河底附近收敛比梯度下降慢得多——正交化移除了残差尺度信息,导致过冲和振荡
方法 提出两阶段训练策略:先 Muon → 后期切到 GD 类优化器进行精炼
结果 在语言模型实验中提供初步证据支持两阶段方案
意义 直接解释了社区长期困惑:为什么 Muon 在 LLM 训练中增益不稳定、对调度敏感。与上期 Rethinking Muon(VLA/RLVR 中谱白化失效)形成互补——这次是在主流预训练场景下指出了收敛瓶颈

两个发现指向相同的「两阶段」方案:AngularMuown 改善了单一 Muon 的可调度性;River-Valley 则从根本上建议换优化器。这可能是未来 LLM 训练的标准模式。


📊 大模型优化器(仅限此前未覆盖的新内容)

🟢 Muon 的收敛理论新进展

1. 收敛分析:退化情况下非精确 LMO 的 Muon 方法(2606.21581,6月19日)

维度 详情
作者 Xun Qian, Peter Richtárik(KAUST)
核心 此前 Muon 的收敛分析要求非退化条件(动量重缩放的最小奇异值有正下界)。本工作消除该假设,在退化情况下建立了收敛率:
  - 一般非凸场景下分层 $(L^0, L^1)$-光滑假设的收敛率
  - 星凸场景下加权重衰减的收敛率
  - 为实践中 LMO 不精确求解提供了理论保障
意义 与上期「Muon 理论整合」浪潮一致——将收敛分析从理想条件扩展到实际场景

2. Open Problem:AdamW 在重尾噪声下是否有效?(2606.23676,6月22日)

维度 详情
作者 Dingzhi Yu, Hongyi Tao, Yuanyu Wan, Luo Luo, Lijun Zhang
核心 LLM 预训练的梯度噪声是重尾的。Lion 和 Muon 已在重尾下获得收敛保证,AdaGrad 也能收敛。但 AdamW 在重尾假设下的收敛理论尚未建立——二阶矩累加器是否构成真正的障碍?
方法 证明了一个正的加权度量基准,给出「走廊下界」机制——分母记忆如何隐藏大梯度
意义 严谨的open problem formulation——比 Muon 更强的理论基础可能源自对重尾噪声的天然鲁棒性。这一视角与此前 NDS 曲率分析和谱缩放定律形成互补

🟢 FORGE:消灭梯度物化——将优化器前推入反向传播(2606.22932,6月22日)

维度 详情
作者 Dikshant Kukreja, Kritarth Prasad, Avinash Anand, Zhengkui Wang, Erik Cambria
核心 反向传播将每层梯度写入内存→优化器再读取,这是人为的内存天花板FORGE 将优化器步融合进反向传播,逐瓦片(tile)在寄存器中执行,梯度产生即消耗
  - 全精度等价:与标准 optimizer 在元素级规则下严格一致
  - bf16/8-bit 保真:跳过 bf16 存储转换,保留高精度
  - 兼容 Tensor Parallelism 和 Sequence Parallelism
结果 显存减少 >50%,小 batch 下加速约 1.5×;集成到 Megatron-LM 后,8B 模型微批大小提升 4 倍
意义 不同于 LOMO/GaLore 等减少优化器状态的方案(上期 Hyperball、MGUP 等),FORGE 从内存调度角度消灭梯度本身——与任何元素级优化器正交,是工程层面最优雅的显存优化方案之一

🟢 谱优化稀疏近似逆预条件(2606.22742,6月22日)

维度 详情
作者 Francesco Brarda, Tianshi Xu, Vassilis Kalantzis, Rui Peng Li, Yuanzhe Xi
核心 提出用谱目标(特征值聚类)而非传统 Frobenius-残差准则来选择稀疏近似逆预条件的非零元素。对对称不定系统引入双模态损失——正特征值聚类到 +1,负特征值聚类到 -1
方法 推导投影 Krylov 支撑梯度,使用 Lanczos 运行估计谱目标,通过分离的 Rayleigh 代理计算梯度
应用 有限元问题 + 图神经网络预测 admissible 元素
意义 虽然主要针对数值线性代数,但其谱目标优化的思路与 Muon 等矩阵优化器的灵魂相通——都关注特征值谱

🟢 其他新论文一览

方向 论文 ID 日期 一句话
Muon 理论 最新发现:以上 3 篇(AngularMuown + River-Valley + Inexact LMO 分析)首次在同一 3 天窗口内出现 Muon 工程、理论和边界分析,反映了社区成熟度      
SOAP 家族 本期无新增 上期大量 SOAP 变体后,本周进入短暂安静期
Shampoo/KFAC 本期无新增 自 Pro-KLShampoo 和 LoRA-Muon 后无新进展
流形优化 本期无新增 上期 Lie-Algebra Attention 后,本周无纯新流形优化论文

🔄 流形优化(仅限此前未覆盖的新内容)

本期无新增内容

过去 3 天 arXiv 上没有出现新的流形优化、黎曼几何或几何深度学习方面的实质进展论文。以下方向均为静默期:

  • 流形优化 × LLM 交叉:无新论文
  • 黎曼优化理论:无新论文
  • 几何深度学习:无新论文
  • 注意力机制几何化:上期 Lie-Algebra Attention(2606.20547)后尚未出现跟进

注意:AngularMuown(2606.23637)虽然使用了「黎曼步」的几何语言,但其核心贡献在优化器设计,已在 📊 部分报道。这反映出 Muon 社区越来越多地借用黎曼几何框架(如归一化方向流形),这方面的交叉可能在未来数周内催生更多显式的流形优化工作


💡 讨论与趋势

1. 「Muon 终结阶段收敛瓶颈」成为本周核心议题

三篇独立工作从不同角度指向同一问题:

工作 角度 方案
AngularMuown 工程:隐式角度步长衰减→显式可调 更好调度,不改优化器本质
River-Valley 理论:河底附近过冲/振荡 建议换优化器:Muon→GD
Inexact LMO 分析 理论:退化情况下保证收敛 证明即便 LMO 不精确仍可收敛

信号清晰:Muon 在大型 LLM 预训练中「早期快、后期慢」的特征已从经验观察上升为理论问题。两阶段策略(前期 Muon 快速探索,后期 GD/AdamW 精细收敛)可能成为标准实践。

2. AdamW 理论地基动摇

「Open Problem: Is AdamW Effective Under Heavy-Tailed Noise?」正式将 AdamW 的理论缺失摆上台面。结合此前 Muon 在重尾噪声下的收敛保证(2603.15059, Free Heavy-Tailed Lunch 2606.14560)——Muon 在重尾场景的理论优势正在加速积累。这可能是 Muon 在实际场景中表现优秀但 AdamW 理论无法解释的原因。

3. FORGE:从「减少状态」到「消灭梯度」的范式转变

优化器显存优化过去两条路径: - 减少状态:LOMO/GaLore/Hyperball → 状态更少 - 选择性更新:MGUP → 只更新部分参数

FORGE 开辟第三条路从调度角度消灭梯度物化本身。梯度零延时消费 + 全精度保真 + 与 TP/SP 兼容。且与任何元素级优化器正交,可叠加到所有前述改进之上。

4. 流形优化短暂静默期

经过前几周 Lie-Algebra Attention、Fisher-Geometric Sharpness、Kuramoto Attention 的密集发表后,本周流形优化进入短暂休整。但 AngularMuown 对归一化方向流形的使用暗示:Muon 研究的几何化趋势可能在下阶段重新激活流形优化与 LLM 的交叉

5. 顺便一提:Plasticity Loss 在 LLM 中的确认(2606.24752,6月23日)

维度 详情
论文 2606.24752
核心 5M-314M GPT 模型上验证塑性损失(plasticity loss)在 LLM 中存在:
  - 海量持续训练后模型适应新数据的能力退化
  - 塑性损失启动遵循可预测的缩放定律(sublinear w.r.t. 规模)
  - 仅在连续学习中存在→稳态多语言训练中同样存在
与优化器的关联 塑性损失直接影响优化器选择——为何重尾鲁棒的优化器(Muon)可能延缓塑性退化?这值得下期跟进

6. 下期关注

  1. AngularMuown 在更大规模(7B+)上的验证
  2. 两阶段训练(Muon→GD)的实验复现和扩展
  3. FORGE 与其他优化器改进(Hyperball, MGUP)的叠加
  4. AdamW 在重尾噪声下的 open problem 是否有新进展
  5. 流形优化是否会在数周内出现新工作——尤其是李群注意力与语言模型的结合

✅ 本期通过 arXiv API 检索了超过 60 篇论文,确认 6 篇新论文,其中 3 篇 Muon 理论/工程(AngularMuown, River-Valley, Inexact LMO)、1 篇内存优化(FORGE)、1 篇 AdamW 理论 open problem、1 篇谱预条件。流形优化方向无新增内容。