大模型优化器 & 流形优化日报 — 2026年6月19日

大模型优化器 & 流形优化日报 — 2026年6月19日

🔬 大模型优化器 & 流形优化日报

覆盖日期:2026年6月16日 – 6月19日 上期成功报告:2026年6月16日 本期执行:2026年6月19日 08:00


📌 本期重点

🔥 1. Hyperball:一种”即插即用”的优化器包装器——20-30% token等效加速(2606.16899)

维度 详情
论文 2606.16899 — 作者未公开
提交 2026年6月15日
问题 Muon 等矩阵优化器在模型和数据规模增大时,相对 AdamW 的增益持续缩小——标准恒定权重衰减失效
核心方案 Hyperball 是一个极简 wrapper:对基础优化器(Adam / Muon),将权重矩阵的 Frobenius 范数和对应的优化器更新范数固定为常数
原理 训练中权重衰减导致平衡权重范数仅依赖超参数 → 权重衰减实际上决定”角度学习率”(方向变化速率)→ Hyperball 直接控制该耦合
结果 Qwen3 风格模型 1.2B 参数上,Muon + Hyperball 比权重衰减基线快 20-30%(token等效);LR 跨宽度/深度迁移性也优于权重衰减
互操作性 兼容 Adam、Muon 等任何基础优化器

意义:上期 Zeta 修复 Muon 的 NS 迭代条件数问题;本期 Hyperball 从权重衰减的正交视角切入,解决了一个被广泛忽视的痛点——Muon 增益在大规模下衰减。两者是正交改进,理论上可叠加。

🔥 2. MGUP:动量-梯度对齐选择性更新——AdamW/Lion/Muon 通用加速(2606.17526)

维度 详情
论文 2606.17526
提交 2026年6月16日
核心 提出 动量-梯度对齐更新策略(MGUP):每步对固定比例的参数施加大学习率,其余参数施小学习率(不归零以保证收敛)
实现 几乎零修改的 plug-and-play 模块,直接集成到 AdamW、Lion、Muon
理论 提供标准假设下的收敛保证
变体 MGUP-AdamW / MGUP-Lion / MGUP-Muon

意义:不同于以往”层选择性更新”(如 DropUpdate)的粗糙粒度,MGUP 在参数粒度实现选择性——这是优化器设计从”全参数同步更新”到”参数级差异化更新”的一个信号。


📊 大模型优化器 — 新论文(限此前未覆盖)

🟢 PC Layer:多项式预条件层——不需要修改优化器(2606.06470,6月4日)

维度 详情
核心 提出预条件层(PC Layer):一种权重参数化,通过低阶多项式预条件重塑权重矩阵的奇异值谱
兼容性 同时改善 AdamW 和 Muon 的 Llama-1B 预训练
理论 证明均匀界住各层奇异值→梯度下降对深度线性网络的全局最小点几何收敛
推理代价 预训练后可合并回原架构,无推理额外开销
代码 论文声称已开源
缺失 上期 Zeta 和本期 Hyperball 都是从外部改造优化器;PC Layer 从权重参数化入手,是第三条独立路径

意义:与 Zeta(双白化)、Hyperball(Frobenius 控制)正交——它不修改优化器逻辑,而是改变权重本身的谱结构。

🟢 Denoise First, Orthogonalize Later:动量在 Muon 中的真正角色(2606.03899,6月2日)

维度 详情
核心发现 Muon 中的动量不仅是加速,更是谱滤波器。在结构化信号+扰动梯度模型下,动量抑制扰动、保留主导信号,从而放大信号与扰动之间的谱间隙
理论 严格证明该滤波特性使后续 NS 正交化更有效
结论 提出 Denoise-First-Orthogonalize-Later 视角——动量不是 Muon 的可选配件,而是正交化能正常工作的前提条件

意义:填补了”动量为什么对 Muon 至关重要”的理论空白——与此前 AMUSE(Muon 河谷景观)形成互补。AMUSE 说动量的节奏要调好,本篇说动量首先是个滤波器。

🟢 MuCon:Clipped Muon——不是全部抹平,而是有界裁剪(2605.26459,5月26日)

维度 详情
方法 提出 MuCon:对 Muon 矩阵 $B=U\Sigma V^\top$ 施加奇异值裁剪而非完全抹平:$U \cdot \operatorname{diag}(\min{\sigma_i,\tau}) \cdot V^\top$
控制参数 阈值 $\tau$ 控制多少信息保留
对比 Muon 把奇异值全部→1;MuCon^p 用分数幂;MuCon 用裁剪阈值——第三条谱控制路径
定位 完整谱控制谱系:Muon(全抹平)→ MuCon(有界裁剪)→ Muon^p(分数幂保留)

意义:与上期 Muon^p(分数谱幂)同期但独立的工作,进一步证明“一刀切谱抹平”正在被谱保留方案全面替代

🟢 Rethinking Muon Beyond Pretraining:Muon 在 VLA 和 RLVR 中的失效(2605.19282,5月19日)

维度 详情
关键发现 Muon 的均匀谱白化在预训练之外可能失效
  (1) VLA(视觉-语言-动作)训练:低秩动作模块梯度→NS 迭代放大噪声尾方向
  (2) RLVR(可验证奖励的强化学习):低信噪比梯度→白化破坏预训练的头专化
方案 提出 High-Pass Remedy——仅对高频谱方向施加正交化,低频保持原梯度方向

意义:这是首次系统验证 Muon 在预训练场景之外可能表现更差。与上期 Muon^p 的结论(微调不宜全抹谱)形成呼应——谱完全白化仅适用于预训练阶段

🟢 Pro-KLShampoo:连接 KL-Shampoo 和 Muon 两大传统(2605.06316,5月7日)

维度 详情
核心观察 KL-Shampoo 的 Kronecker 预条件矩阵呈现 “尖峰+平坦”谱形状——少数主导特征值+近似均匀尾
连接 该谱结构恰好支持通过白化(whitening)恢复正交性——正是 Muon 所做的工作
结论 推导 Pro-KLShampoo,显式将两个传统统一在一个框架下

意义:提供了一个理论视角——Shampoo 和 Muon 并非对立方案,而是同一谱控制谱系的不同端点。KL-Shampoo ≈ 保持完整谱信息 + 昂贵的Kr分解;Muon ≈ 完全抹平谱 + 廉价的正交化。

🟢 Muon Learns More Robust and Transferable Features(2606.09658,6月8日)

维度 详情
核心 在损坏图像/文本上的评估表明:Muon 训练的模型相比 Adam 训练的模型,特征更鲁棒且更可迁移
涵盖 LLM 和视觉分类器

📊 新论文一览(均未在6/13和6/16期报道)

论文 ID 日期 方向 核心贡献
Hyperball 2606.16899 6/15 优化器wrapper Frobenius 范数控制,Muon 20-30%加速
MGUP 2606.17526 6/16 选择性更新 参数级动量-梯度对齐,兼容AdamW/Lion/Muon
PC Layer 2606.06470 6/4 权重参数化 多项式预条件改善谱结构,无推理代价
Denoise First 2606.03899 6/2 Muon 理论 动量=谱滤波器,正交化的前提
MuCon 2605.26459 5/26 Muon 变体 裁剪裁剪奇异值,非完全抹平
Rethinking Muon 2605.19282 5/19 Muon 局限性 VLA/RLVR 中谱白化失效,高通过滤
Pro-KLShampoo 2605.06316 5/7 Shampoo×Muon 统一 Kronecker 预条件和谱正交化
Muon Robust Features 2606.09658 6/8 特征质量 Muon 特征更鲁棒更可迁移

🔄 流形优化(仅限此前未覆盖的新内容)

🟢 Riemannian GD for Low-Rank Architectures:流形优化在 Transformer 中的系统性测试(2606.02328,6月1日)

维度 详情
论文 2606.02328
范围 系统探索 10 个算法设计点:2种秩-$r$ 流形几何 + 3种秩-$r$ 部分等距流形几何 + 对应的分块变体
应用 应用于多头注意力参数(小语言模型)
结果 调参后的流形方法未决定性地超越 AdamW 基线
代码 已开源
讨论 作者坦率指出:流形优化在 Transformer 低秩参数上的优势不显著——这与上期 PermDoRA(参数空间几何无法解释 LoRA 干扰)结论一致

意义:一个”诚实的负面结果”。与上期模块感知流形(Stiefel+DGram 在特定配置下有效)形成对比——流形约束在小语言模型上并非通用的 silver bullet。这也解释了为何上期 Kuramoto Attention 的 1M LM 尽管在流形上运行正常,但规模放大后优势会稀释。

其他方向

方向 状态
流形×LLM 交叉 Riemannian GD for Low-Rank 直接测试(但未胜出);Rethinking Muon 的谱失效也涉及流形几何
黎曼优化理论 本期无新增纯理论
几何深度学习 无新增

💡 讨论与趋势

1. Muon 研究进入「精细化修复」阶段

过去三周的发展展现了清晰的演进路径:

阶段 时间 特征 代表
🧪 变体爆发 5月 各种 Muon 变体 Pion, MONA, NuMuon, SPECTRA
📐 理论深化 5月底–6月初 解释Muon为何有效 NDS曲率, SoSD, 谱缩放律, Denoise First
🔧 工程化修复 6月中 修复已知问题 Zeta(NS条件数), Hyperball(大规模增益衰减)
⚠️ 边界发现 6月中下旬 揭示失效场景 Rethinking Muon(VLA/RLVR), Muon^p(微调不宜全抹)

Zeta + Hyperball + Muon^p + MuCon 四个正交改进理论上可叠加——统一的「超优化器」正在成形

2. “谱完全白化”教条正在被推翻

从最初的 Muon(全抹平 $UV^\top$)到最新谱系:

  • Muon(原始)→ 预训练场景最优
  • MuCon → 有界裁剪(裁剪 > 阈值)
  • Muon^p → 分数谱幂(部分保留)
  • Rethinking Muon → 高通过滤(仅高频正交化)
  • PC Layer → 多项式预条件重塑谱
  • Zeta → 双白化使正交化更可靠

共识正在形成:谱操作的最优方式因场景而异,一刀切白化仅对预训练有效

3. Connection:KL-Shampoo 和 Muon 的统一

Pro-KLShampoo 从谱结构证明了 KL-Shampoo 的 Kronecker 预条件和 Muon 的谱正交化本质上是同一数学对象的不同视角。这暗示:

未来优化器设计可能不需要在 Shampoo(昂贵的二阶信息)和 Muon(廉价的零阶正交化)之间做选择——两者可以融合。

4. 流形优化在 LLM 中的前景——仍需谨慎

Riemannian GD for Low-Rank 的负面结果 + PermDoRA 的参数空间几何无效论 + 模块感知流形只在特定配置有效——三条独立证据共同指向:流形约束在小/中规模语言模型上尚未展现压倒性优势。Kuramoto Attention 是否能在大规模下维持优势仍是开放问题。

5. 下期关注

  1. Hyperball + Zeta 叠加实验——两项正交改进能否叠加
  2. MGUP 在 >1B 模型上的验证
  3. Rethinking Muon 的 High-Pass 开源
  4. Pro-KLShampoo 在更大规模上的验证
  5. ICML 2026 正式录用名单公布后的论文综述