大模型优化器 & 流形优化日报 — 2026年6月25日
大模型优化器 & 流形优化日报 — 2026年6月25日
🔬 大模型优化器 & 流形优化日报
覆盖日期:2026年6月22日 – 6月25日 上期成功报告:2026年6月22日 本期执行:2026年6月25日 08:00
📌 本期重点
🔥 1. AngularMuown:将隐式角度步长衰减显式化,已在 nanoGPT 竞速赛领先(2606.23637)
提交日期:6月22日
| 维度 | 详情 |
|---|---|
| 论文 | 2606.23637 |
| 作者 | Florian Hübler, Kai Lion, Antonio Orvieto, Niao He(ETH Zürich) |
| 核心洞察 | Muown 将权重矩阵分解为行幅度和未归一化的方向变量,方向变量用 Muon 更新。本文证明方向更新等价于归一化方向上的黎曼步,而幅度参数仅调制角度步长 |
| 方法 | AngularMuown:解耦角度步长与径向幅度更新,直接优化归一化方向,使用可调度的角度乘子 |
| 结果 | AngularMuown 在 modded nanoGPT speedrunning 竞赛的 per-optimizer 类别中领先;Qwen2-0.5B 和 1.1B MoE 上均超越原始 Muown |
| 代码 | 已开源:github.com/fhueb/angular-muown |
| 意义 | 这是对前几期「Muon 的谱控制」讨论的直接工程化落地——将隐式的几何特性显式建模为可调超参数,实现了更好的可调度性和迁移性 |
与上期衔接:上期 CacheMuon 利用时间冗余,本期 AngularMuown 将隐式几何参数显式化。两者正交,可以叠加。
🔥 2. River-Valley 视角:Muon 为何在最终阶段收敛慢——提出 Muon→GD 两阶段策略(2606.21514)
提交日期:6月19日
| 维度 | 详情 |
|---|---|
| 论文 | 2606.21514 |
| 作者 | Tianqi Shen, Jinji Yang, Runze Shi, Jianhao Ma, Jiaye Teng |
| 核心发现 | 提出河流-山谷(river-valley)视角:景观由流向解的河流方向和编码噪声的山丘方向组成。Muon 在早期沿河流方向移动更快,但在河底附近收敛比梯度下降慢得多——正交化移除了残差尺度信息,导致过冲和振荡 |
| 方法 | 提出两阶段训练策略:先 Muon → 后期切到 GD 类优化器进行精炼 |
| 结果 | 在语言模型实验中提供初步证据支持两阶段方案 |
| 意义 | 直接解释了社区长期困惑:为什么 Muon 在 LLM 训练中增益不稳定、对调度敏感。与上期 Rethinking Muon(VLA/RLVR 中谱白化失效)形成互补——这次是在主流预训练场景下指出了收敛瓶颈 |
⚡ 两个发现指向相同的「两阶段」方案:AngularMuown 改善了单一 Muon 的可调度性;River-Valley 则从根本上建议换优化器。这可能是未来 LLM 训练的标准模式。
📊 大模型优化器(仅限此前未覆盖的新内容)
🟢 Muon 的收敛理论新进展
1. 收敛分析:退化情况下非精确 LMO 的 Muon 方法(2606.21581,6月19日)
| 维度 | 详情 |
|---|---|
| 作者 | Xun Qian, Peter Richtárik(KAUST) |
| 核心 | 此前 Muon 的收敛分析要求非退化条件(动量重缩放的最小奇异值有正下界)。本工作消除该假设,在退化情况下建立了收敛率: |
| - 一般非凸场景下分层 $(L^0, L^1)$-光滑假设的收敛率 | |
| - 星凸场景下加权重衰减的收敛率 | |
| - 为实践中 LMO 不精确求解提供了理论保障 | |
| 意义 | 与上期「Muon 理论整合」浪潮一致——将收敛分析从理想条件扩展到实际场景 |
2. Open Problem:AdamW 在重尾噪声下是否有效?(2606.23676,6月22日)
| 维度 | 详情 |
|---|---|
| 作者 | Dingzhi Yu, Hongyi Tao, Yuanyu Wan, Luo Luo, Lijun Zhang |
| 核心 | LLM 预训练的梯度噪声是重尾的。Lion 和 Muon 已在重尾下获得收敛保证,AdaGrad 也能收敛。但 AdamW 在重尾假设下的收敛理论尚未建立——二阶矩累加器是否构成真正的障碍? |
| 方法 | 证明了一个正的加权度量基准,给出「走廊下界」机制——分母记忆如何隐藏大梯度 |
| 意义 | 严谨的open problem formulation——比 Muon 更强的理论基础可能源自对重尾噪声的天然鲁棒性。这一视角与此前 NDS 曲率分析和谱缩放定律形成互补 |
🟢 FORGE:消灭梯度物化——将优化器前推入反向传播(2606.22932,6月22日)
| 维度 | 详情 |
|---|---|
| 作者 | Dikshant Kukreja, Kritarth Prasad, Avinash Anand, Zhengkui Wang, Erik Cambria |
| 核心 | 反向传播将每层梯度写入内存→优化器再读取,这是人为的内存天花板。FORGE 将优化器步融合进反向传播,逐瓦片(tile)在寄存器中执行,梯度产生即消耗 |
| - 全精度等价:与标准 optimizer 在元素级规则下严格一致 | |
| - bf16/8-bit 保真:跳过 bf16 存储转换,保留高精度 | |
| - 兼容 Tensor Parallelism 和 Sequence Parallelism | |
| 结果 | 显存减少 >50%,小 batch 下加速约 1.5×;集成到 Megatron-LM 后,8B 模型微批大小提升 4 倍 |
| 意义 | 不同于 LOMO/GaLore 等减少优化器状态的方案(上期 Hyperball、MGUP 等),FORGE 从内存调度角度消灭梯度本身——与任何元素级优化器正交,是工程层面最优雅的显存优化方案之一 |
🟢 谱优化稀疏近似逆预条件(2606.22742,6月22日)
| 维度 | 详情 |
|---|---|
| 作者 | Francesco Brarda, Tianshi Xu, Vassilis Kalantzis, Rui Peng Li, Yuanzhe Xi |
| 核心 | 提出用谱目标(特征值聚类)而非传统 Frobenius-残差准则来选择稀疏近似逆预条件的非零元素。对对称不定系统引入双模态损失——正特征值聚类到 +1,负特征值聚类到 -1 |
| 方法 | 推导投影 Krylov 支撑梯度,使用 Lanczos 运行估计谱目标,通过分离的 Rayleigh 代理计算梯度 |
| 应用 | 有限元问题 + 图神经网络预测 admissible 元素 |
| 意义 | 虽然主要针对数值线性代数,但其谱目标优化的思路与 Muon 等矩阵优化器的灵魂相通——都关注特征值谱 |
🟢 其他新论文一览
| 方向 | 论文 | ID | 日期 | 一句话 |
|---|---|---|---|---|
| Muon 理论 | 最新发现:以上 3 篇(AngularMuown + River-Valley + Inexact LMO 分析)首次在同一 3 天窗口内出现 Muon 工程、理论和边界分析,反映了社区成熟度 | |||
| SOAP 家族 | 本期无新增 | — | — | 上期大量 SOAP 变体后,本周进入短暂安静期 |
| Shampoo/KFAC | 本期无新增 | — | — | 自 Pro-KLShampoo 和 LoRA-Muon 后无新进展 |
| 流形优化 | 本期无新增 | — | — | 上期 Lie-Algebra Attention 后,本周无纯新流形优化论文 |
🔄 流形优化(仅限此前未覆盖的新内容)
本期无新增内容
过去 3 天 arXiv 上没有出现新的流形优化、黎曼几何或几何深度学习方面的实质进展论文。以下方向均为静默期:
- 流形优化 × LLM 交叉:无新论文
- 黎曼优化理论:无新论文
- 几何深度学习:无新论文
- 注意力机制几何化:上期 Lie-Algebra Attention(2606.20547)后尚未出现跟进
注意:AngularMuown(2606.23637)虽然使用了「黎曼步」的几何语言,但其核心贡献在优化器设计,已在 📊 部分报道。这反映出 Muon 社区越来越多地借用黎曼几何框架(如归一化方向流形),这方面的交叉可能在未来数周内催生更多显式的流形优化工作。
💡 讨论与趋势
1. 「Muon 终结阶段收敛瓶颈」成为本周核心议题
三篇独立工作从不同角度指向同一问题:
| 工作 | 角度 | 方案 |
|---|---|---|
| AngularMuown | 工程:隐式角度步长衰减→显式可调 | 更好调度,不改优化器本质 |
| River-Valley | 理论:河底附近过冲/振荡 | 建议换优化器:Muon→GD |
| Inexact LMO 分析 | 理论:退化情况下保证收敛 | 证明即便 LMO 不精确仍可收敛 |
信号清晰:Muon 在大型 LLM 预训练中「早期快、后期慢」的特征已从经验观察上升为理论问题。两阶段策略(前期 Muon 快速探索,后期 GD/AdamW 精细收敛)可能成为标准实践。
2. AdamW 理论地基动摇
「Open Problem: Is AdamW Effective Under Heavy-Tailed Noise?」正式将 AdamW 的理论缺失摆上台面。结合此前 Muon 在重尾噪声下的收敛保证(2603.15059, Free Heavy-Tailed Lunch 2606.14560)——Muon 在重尾场景的理论优势正在加速积累。这可能是 Muon 在实际场景中表现优秀但 AdamW 理论无法解释的原因。
3. FORGE:从「减少状态」到「消灭梯度」的范式转变
优化器显存优化过去两条路径: - 减少状态:LOMO/GaLore/Hyperball → 状态更少 - 选择性更新:MGUP → 只更新部分参数
FORGE 开辟第三条路:从调度角度消灭梯度物化本身。梯度零延时消费 + 全精度保真 + 与 TP/SP 兼容。且与任何元素级优化器正交,可叠加到所有前述改进之上。
4. 流形优化短暂静默期
经过前几周 Lie-Algebra Attention、Fisher-Geometric Sharpness、Kuramoto Attention 的密集发表后,本周流形优化进入短暂休整。但 AngularMuown 对归一化方向流形的使用暗示:Muon 研究的几何化趋势可能在下阶段重新激活流形优化与 LLM 的交叉。
5. 顺便一提:Plasticity Loss 在 LLM 中的确认(2606.24752,6月23日)
| 维度 | 详情 |
|---|---|
| 论文 | 2606.24752 |
| 核心 | 5M-314M GPT 模型上验证塑性损失(plasticity loss)在 LLM 中存在: |
| - 海量持续训练后模型适应新数据的能力退化 | |
| - 塑性损失启动遵循可预测的缩放定律(sublinear w.r.t. 规模) | |
| - 仅在连续学习中存在→稳态多语言训练中同样存在 | |
| 与优化器的关联 | 塑性损失直接影响优化器选择——为何重尾鲁棒的优化器(Muon)可能延缓塑性退化?这值得下期跟进 |
6. 下期关注
- AngularMuown 在更大规模(7B+)上的验证
- 两阶段训练(Muon→GD)的实验复现和扩展
- FORGE 与其他优化器改进(Hyperball, MGUP)的叠加
- AdamW 在重尾噪声下的 open problem 是否有新进展
- 流形优化是否会在数周内出现新工作——尤其是李群注意力与语言模型的结合
✅ 本期通过 arXiv API 检索了超过 60 篇论文,确认 6 篇新论文,其中 3 篇 Muon 理论/工程(AngularMuown, River-Valley, Inexact LMO)、1 篇内存优化(FORGE)、1 篇 AdamW 理论 open problem、1 篇谱预条件。流形优化方向无新增内容。