大模型优化器 & 流形优化日报 — 2026年6月22日

大模型优化器 & 流形优化日报 — 2026年6月22日

🔬 大模型优化器 & 流形优化日报

覆盖日期:2026年6月19日 – 6月22日 上期成功报告:2026年6月19日 本期执行:2026年6月22日 08:00


📌 本期重点

🔥 1. CacheMuon:利用时间相关性降低 Muon 正交化计算开销(2606.16371)

提交日期:6月15日

维度 详情
论文 2606.16371
作者 Bishnu Dev, Sushil Bohara, Martin Takáč, Samuel Horváth
核心洞察 Muon 的 Newton-Schulz 迭代在每个训练步独立计算 polar factor,但 连续训练步之间的 polar factor 高度时间相关——相近步的梯度矩阵的 SVD 分解差异很小
方法 CacheMuon:缓存前一步的 polar factor,仅在变化超过阈值时重算;提供可控的精度-效率前沿
结果 保守阈值下匹配原始 Muon 的损失曲线,同时显著降低正交化 FLOPs(TPU 实测)
意义 这是首个利用 时间维度冗余 优化 Muon 效率的工作——与 Zeta(空间维度上改善正交化可靠性)正交,可叠加

意义:前两期我们看到了 Muon 的各类改进纷纷出现。CacheMuon 另辟蹊径——不是改善正交化质量,而是减少不必要的正交化。在 Zeta+Hyperball+MuCon 这一串谱线改进之外打开了新的效率维度。

🔥 2. Schattor:Schatten-范数优化框架——统一 SGD 和 Muon(2606.15702)

提交日期:6月14日

维度 详情
论文 2606.15702
作者 Bohao Ma, Junyu Zhang, Chuan He
核心方案 提出 Schattor,在统一的 Schatten-范数框架下将 SGD(对应核范数)和 Muon(对应谱范数/矩阵正交性) 统一
理论贡献 建立无维度依赖的驻点保证(dimension-free stationarity guarantees),通过新颖的矩阵鞅矩界
扩展 支持多块(multi-block)扩展
意义 这是继上期 Pro-KLShampoo 统一 Shampoo 和 Muon 之后的第二个”大统一”理论框架——将 SGD 和 Muon 放在了同一张 Schatten-范数地图上

与上期衔接:Pro-KLShampoo(2605.06316)统一了 Kronecker 预条件和谱正交化;Schattor 将统一范围扩大到涵盖基本 SGD。两个统一视角互补。


📊 大模型优化器(仅限此前未覆盖的新内容)

🟢 何时使用何种 Schatten-p 范数?(2606.15268,6月13日)

  • 作者:Thomas Pethick(上期 Free Heavy-Tailed Lunch 的共同作者)
  • 核心解决了关于 Muon 类方法的矛盾观察——最优区域是 Schatten-p 依赖的。
    • 低维/小模型阶段(Chinchilla scaling 区域)→ 更小的 $p$ 值最优
    • 解释:为什么 Muon 不需要 warmup?为什么 Muon 偏爱大 batch?推导出 batch scaling rule
  • 意义:为”什么时候用 Muon、什么时候应回退”提供了实用指南——与上期 Muon^p 和 MuCon 在谱上插值的结论形成完整的「谱选择理论」

🟢 Muon 在 Vision Transformer 中的表现(2605.24770,5月23日)

  • 作者:Ben S. Southworth 等(5位作者,含多名 DOE 实验室研究员)
  • 范围:ViT 训练在 ImageNet-100 和 Pl@ntNet-300K 上
  • 发现
    • Muon 始终优于 AdamW
    • 分析了 QKV 梯度的奇异值结构——Muon 将梯度能量分布在更多的奇异模式上,谱更宽
    • 数据增强越强,Muon 的优势越大
  • 与 LLM 场景的呼应:与上期 Muon Robust Features(2606.09658,显示 Muon 特征更鲁棒)在视觉领域独立验证了同样的结论

🟢 Momentum Streams:优化器启发的 Transformer 架构(2605.24425,5月23日)

  • 作者:Jingchu Gai, Nai-Chieh Huang, Jiayun Wu
  • 核心:将优化器(带动量)的更新规则嵌入 Transformer 架构本身——构建三重动量、Adam/AdamW、Muon、SOAP 启发的注意力
  • 关键发现:动量(而非预条件器)是性能提升的主要来源;TMMFormer(三重动量)达到最低验证损失;动量设计达到更平坦的极小值
  • 意义:从”如何训练”转向”如何设计架构来隐式使用更好的优化器”——动量是 Transformer 架构设计中被低估的因素

🟢 Move on Muon:哈密顿概率梯度流视角(2605.23871,5月22日)

  • 作者:Aratrika Mustafi, Soumya Mukherjee, Bharath K. Sriperumbudur
  • 核心:将 Muon 的正则化版本解释为概率测度上的梯度流——正则化正交化映射是核范数的Fenchel-对偶平滑的梯度
  • 理论:推导阻尼哈密顿概率动力学,证明哈密顿耗散恒等式和指数收敛速率
  • 扩展:支持块级 Muon 用于 MoE 模型
  • 意义:与 Free Heavy-Tailed Lunch(2606.14560)形成理论双壁——Sra 团队从样本复杂度角度证明 Muon 最优,本工作从概率梯度流角度提供哈密顿动力学视角。

🟢 重尾引导的逐层学习率(2605.22297,5月21日)

  • 作者:Di He, Songjun Tu, Keyu Wang, Lu Yin, Shiwei Liu
  • 核心:基于重尾自正则化理论(Heavy-Tailed Self-Regularization)为每层分配差异化学习率——信息瓶颈特征/尾部更重的层获得更大 LR
  • 结果
    • 60M 到 3B 参数(LLaMA, GPT-nano),兼容 AdamW 和 Muon
    • 最高 1.5× 训练加速
    • 1B 模型 zero-shot:47.09% → 49.02%;3B:48.58% → 50.61%
  • 意义:与上期 MGUP(参数级选择性更新)目标相同但路径不同——MGUP 在参数粒度做选择性更新,本工作从信息论/重尾分布角度做层级别差异化。两者是互补思路。

🔄 流形优化(仅限此前未覆盖的新内容)

🟢 Token 是群元素:矩阵李群上的李代数注意力(2606.20547,6月18日)

  • 作者:Przemyslaw Musialski
  • 核心:将注意力 token 直接放在矩阵李群上——token 是裸群元素(无特征负载)。提出李代数注意力(Lie-Algebra Attention):注意力分数是相对位姿的闭式代数范数
  • 覆盖范围:可处理非紧致非阿贝尔仿射全帧群——向量 token 注意力方法无法触及
  • 实证:SE(2)、SO(3)、Aff(2) 上的实验——闭式分数匹配学习的 MLP kernel,参数减少 50-80×
  • 与上期 Kuramoto Attention(2606.11585)对比
    • Kuramoto:注意力在圆环面 $S^1$ 上,角度同步 → 百万参数级 LM 可工作
    • 本工作:注意力在任何矩阵李群上,包括非紧致群 → 不限于语言建模,适用于点云、姿态估计等几何场景
  • 意义:这是注意力机制最广泛的几何化方案——从 $S^1$(Kuramoto)到任意矩阵李群。虽然目前聚焦几何场景而非 LLM,但它为注意力+流形优化+大规模训练的三方融合提供了新的数学框架。

🟢 Fisher-几何锐度:SGD 隐含偏向平坦极小值的黎曼几何解释(2606.20469,6月18日)

  • 作者:Md Sakir Ahmed, Kumaresh Sarmah, Hemen Dutta
  • 核心:将「平坦极小值」的直觉严格建立在 Fisher 信息矩阵(FIM)诱导的统计流形黎曼几何上:
    • 证明黎曼锐度在保函数的平滑重参数化下不变——克服了欧几里得锐度对参数化的敏感问题
    • 推导 SGD 作为 SDE 的平稳分布→概率质量集中在黎曼-平坦极小值
    • PAC-Bayes 界将几何偏差与测试性能联系起来
  • 实证:MNIST、CIFAR-10 上 SR(黎曼锐度)跟踪泛化能力,而欧几里得锐度不能
  • 意义:这是迄今对 SGD 隐含偏差最严谨的黎曼几何解释。与上期 Free Heavy-Tailed Lunch 从样本复杂度论证 Muon 最优,本工作从泛化几何角度论证 SGD 的平坦偏向——两个优化器的优势可从不同几何视角理解

🟢 Fisher Width:统计流形上的几何复杂度度量(2606.18306,6月16日)

  • 作者:Vu Khac Ky
  • 核心:提出 Fisher width——统计流形上高斯宽度的 Fisher-几何类比,在平滑重参数化下不变
  • 理论:对 Fisher-Lipschitz 假设类证明泛化界
  • 意义:这是上期 Fisher 几何方向(PermDoRA 发现参数空间几何无法解释 LoRA 干扰)的理论补充——Fisher 几何虽然无法解释 LoRA 干扰,但在统计流形层次上仍然是有效的复杂度度量。

💡 讨论与趋势

1. Muon 理论的「统一化」浪潮

工作 统一了什么 统一视角
Pro-KLShampoo(5/7,上期) Shampoo × Muon Kronecker 预条件 = 谱正交化
Schattor(6/14,本期 ★) SGD × Muon Schatten-范数框架
Move on Muon(5/22) Muon × 哈密顿动力学 概率测度梯度流
Free Heavy-Tailed Lunch(6/12,上期) Muon × 非凸优化 核范数样本复杂度最优
Schatten-p 指南(6/13,本期) 何时用什么范数 $p$ 值选择实用指南

信号非常清晰:Muon 社区正在从「变体竞赛」进入「理论整合」阶段。三个独立的理论框架(Kronecker、Schatten、概率测度流)分别从不同角度统一了 Muon 与既有优化方法。

2. 「缓存」成为 Muon 效率新维度

上期关注点主要是正交化质量(Zeta 的谱条件数修复)和谱控制(Hyperball 的范数约束)。本期 CacheMuon 开创了第三个维度:利用时间冗余减少正交化频率。这在工程部署层面有重要意义——Muon 的 NS 迭代虽然理论复杂度低,但在实际 TPU 上仍是瓶颈。

3. 流形优化的注意力几何化——从 $S^1$ 到任意李群

阶段 代表 核心思想
🏗 架构级 Kuramoto Attention(6/10,上期) 注意力在 $S^1$ 圆环面上
🚀 突破 Lie-Algebra Attention(6/18,本期 ★) 注意力在任何矩阵李群上
📐 理论 Fisher-Geometric Sharpness(6/18) SGD 平坦偏向的黎曼几何基础

两周之内,注意力机制的几何化从 $S^1$ 扩展到任意矩阵李群。虽然 Lie-Algebra Attention 尚未在语言模型上验证,但其通用性为未来流形优化与 LLM 训练的融合提供了新的可能性。

4. 优化器+架构协同设计的萌芽

Momentum Streams(本期)将优化器更新规则嵌入 Transformer 架构——这标志着优化器和架构不再是独立设计的问题。动量在注意力头之间”流动”的方式可能比注意力头本身的计算更重要。这是对 Transformer 设计基本假设的挑战。

5. 下期关注

  1. CacheMuon + Zeta 组合——质量修复+效率降低能否叠加
  2. Schattor 的实证验证——在 1B+ 模型上是否成立
  3. Lie-Algebra Attention 扩展到语言建模——验证其 LLM 潜力
  4. Heavy-Tail LLR 在更大模型和 Muon 下的表现
  5. ICML 2026 正式论文发布——6月下旬是 ICML 2026 论文上线的时间窗口

📦 存档信息

  • 本期共收录 10 篇新论文(7 篇大模型优化器 + 3 篇流形优化)
  • 本期 0 个新工具/GitHub 仓库
  • 无新社区讨论