大模型优化器 & 流形优化日报 — 2026年6月19日
大模型优化器 & 流形优化日报 — 2026年6月19日
🔬 大模型优化器 & 流形优化日报
覆盖日期:2026年6月16日 – 6月19日 上期成功报告:2026年6月16日 本期执行:2026年6月19日 08:00
📌 本期重点
🔥 1. Hyperball:一种”即插即用”的优化器包装器——20-30% token等效加速(2606.16899)
| 维度 | 详情 |
|---|---|
| 论文 | 2606.16899 — 作者未公开 |
| 提交 | 2026年6月15日 |
| 问题 | Muon 等矩阵优化器在模型和数据规模增大时,相对 AdamW 的增益持续缩小——标准恒定权重衰减失效 |
| 核心方案 | Hyperball 是一个极简 wrapper:对基础优化器(Adam / Muon),将权重矩阵的 Frobenius 范数和对应的优化器更新范数固定为常数 |
| 原理 | 训练中权重衰减导致平衡权重范数仅依赖超参数 → 权重衰减实际上决定”角度学习率”(方向变化速率)→ Hyperball 直接控制该耦合 |
| 结果 | Qwen3 风格模型 1.2B 参数上,Muon + Hyperball 比权重衰减基线快 20-30%(token等效);LR 跨宽度/深度迁移性也优于权重衰减 |
| 互操作性 | 兼容 Adam、Muon 等任何基础优化器 |
意义:上期 Zeta 修复 Muon 的 NS 迭代条件数问题;本期 Hyperball 从权重衰减的正交视角切入,解决了一个被广泛忽视的痛点——Muon 增益在大规模下衰减。两者是正交改进,理论上可叠加。
🔥 2. MGUP:动量-梯度对齐选择性更新——AdamW/Lion/Muon 通用加速(2606.17526)
| 维度 | 详情 |
|---|---|
| 论文 | 2606.17526 |
| 提交 | 2026年6月16日 |
| 核心 | 提出 动量-梯度对齐更新策略(MGUP):每步对固定比例的参数施加大学习率,其余参数施小学习率(不归零以保证收敛) |
| 实现 | 几乎零修改的 plug-and-play 模块,直接集成到 AdamW、Lion、Muon |
| 理论 | 提供标准假设下的收敛保证 |
| 变体 | MGUP-AdamW / MGUP-Lion / MGUP-Muon |
意义:不同于以往”层选择性更新”(如 DropUpdate)的粗糙粒度,MGUP 在参数粒度实现选择性——这是优化器设计从”全参数同步更新”到”参数级差异化更新”的一个信号。
📊 大模型优化器 — 新论文(限此前未覆盖)
🟢 PC Layer:多项式预条件层——不需要修改优化器(2606.06470,6月4日)
| 维度 | 详情 |
|---|---|
| 核心 | 提出预条件层(PC Layer):一种权重参数化,通过低阶多项式预条件重塑权重矩阵的奇异值谱 |
| 兼容性 | 同时改善 AdamW 和 Muon 的 Llama-1B 预训练 |
| 理论 | 证明均匀界住各层奇异值→梯度下降对深度线性网络的全局最小点几何收敛 |
| 推理代价 | 预训练后可合并回原架构,无推理额外开销 |
| 代码 | 论文声称已开源 |
| 缺失 | 上期 Zeta 和本期 Hyperball 都是从外部改造优化器;PC Layer 从权重参数化入手,是第三条独立路径 |
意义:与 Zeta(双白化)、Hyperball(Frobenius 控制)正交——它不修改优化器逻辑,而是改变权重本身的谱结构。
🟢 Denoise First, Orthogonalize Later:动量在 Muon 中的真正角色(2606.03899,6月2日)
| 维度 | 详情 |
|---|---|
| 核心发现 | Muon 中的动量不仅是加速,更是谱滤波器。在结构化信号+扰动梯度模型下,动量抑制扰动、保留主导信号,从而放大信号与扰动之间的谱间隙 |
| 理论 | 严格证明该滤波特性使后续 NS 正交化更有效 |
| 结论 | 提出 Denoise-First-Orthogonalize-Later 视角——动量不是 Muon 的可选配件,而是正交化能正常工作的前提条件 |
意义:填补了”动量为什么对 Muon 至关重要”的理论空白——与此前 AMUSE(Muon 河谷景观)形成互补。AMUSE 说动量的节奏要调好,本篇说动量首先是个滤波器。
🟢 MuCon:Clipped Muon——不是全部抹平,而是有界裁剪(2605.26459,5月26日)
| 维度 | 详情 |
|---|---|
| 方法 | 提出 MuCon:对 Muon 矩阵 $B=U\Sigma V^\top$ 施加奇异值裁剪而非完全抹平:$U \cdot \operatorname{diag}(\min{\sigma_i,\tau}) \cdot V^\top$ |
| 控制参数 | 阈值 $\tau$ 控制多少信息保留 |
| 对比 | Muon 把奇异值全部→1;MuCon^p 用分数幂;MuCon 用裁剪阈值——第三条谱控制路径 |
| 定位 | 完整谱控制谱系:Muon(全抹平)→ MuCon(有界裁剪)→ Muon^p(分数幂保留) |
意义:与上期 Muon^p(分数谱幂)同期但独立的工作,进一步证明“一刀切谱抹平”正在被谱保留方案全面替代。
🟢 Rethinking Muon Beyond Pretraining:Muon 在 VLA 和 RLVR 中的失效(2605.19282,5月19日)
| 维度 | 详情 |
|---|---|
| 关键发现 | Muon 的均匀谱白化在预训练之外可能失效: |
| (1) VLA(视觉-语言-动作)训练:低秩动作模块梯度→NS 迭代放大噪声尾方向 | |
| (2) RLVR(可验证奖励的强化学习):低信噪比梯度→白化破坏预训练的头专化 | |
| 方案 | 提出 High-Pass Remedy——仅对高频谱方向施加正交化,低频保持原梯度方向 |
意义:这是首次系统验证 Muon 在预训练场景之外可能表现更差。与上期 Muon^p 的结论(微调不宜全抹谱)形成呼应——谱完全白化仅适用于预训练阶段。
🟢 Pro-KLShampoo:连接 KL-Shampoo 和 Muon 两大传统(2605.06316,5月7日)
| 维度 | 详情 |
|---|---|
| 核心观察 | KL-Shampoo 的 Kronecker 预条件矩阵呈现 “尖峰+平坦”谱形状——少数主导特征值+近似均匀尾 |
| 连接 | 该谱结构恰好支持通过白化(whitening)恢复正交性——正是 Muon 所做的工作 |
| 结论 | 推导 Pro-KLShampoo,显式将两个传统统一在一个框架下 |
意义:提供了一个理论视角——Shampoo 和 Muon 并非对立方案,而是同一谱控制谱系的不同端点。KL-Shampoo ≈ 保持完整谱信息 + 昂贵的Kr分解;Muon ≈ 完全抹平谱 + 廉价的正交化。
🟢 Muon Learns More Robust and Transferable Features(2606.09658,6月8日)
| 维度 | 详情 |
|---|---|
| 核心 | 在损坏图像/文本上的评估表明:Muon 训练的模型相比 Adam 训练的模型,特征更鲁棒且更可迁移 |
| 涵盖 | LLM 和视觉分类器 |
📊 新论文一览(均未在6/13和6/16期报道)
| 论文 | ID | 日期 | 方向 | 核心贡献 |
|---|---|---|---|---|
| Hyperball ★ | 2606.16899 | 6/15 | 优化器wrapper | Frobenius 范数控制,Muon 20-30%加速 |
| MGUP ★ | 2606.17526 | 6/16 | 选择性更新 | 参数级动量-梯度对齐,兼容AdamW/Lion/Muon |
| PC Layer | 2606.06470 | 6/4 | 权重参数化 | 多项式预条件改善谱结构,无推理代价 |
| Denoise First | 2606.03899 | 6/2 | Muon 理论 | 动量=谱滤波器,正交化的前提 |
| MuCon | 2605.26459 | 5/26 | Muon 变体 | 裁剪裁剪奇异值,非完全抹平 |
| Rethinking Muon | 2605.19282 | 5/19 | Muon 局限性 | VLA/RLVR 中谱白化失效,高通过滤 |
| Pro-KLShampoo | 2605.06316 | 5/7 | Shampoo×Muon | 统一 Kronecker 预条件和谱正交化 |
| Muon Robust Features | 2606.09658 | 6/8 | 特征质量 | Muon 特征更鲁棒更可迁移 |
🔄 流形优化(仅限此前未覆盖的新内容)
🟢 Riemannian GD for Low-Rank Architectures:流形优化在 Transformer 中的系统性测试(2606.02328,6月1日)
| 维度 | 详情 |
|---|---|
| 论文 | 2606.02328 |
| 范围 | 系统探索 10 个算法设计点:2种秩-$r$ 流形几何 + 3种秩-$r$ 部分等距流形几何 + 对应的分块变体 |
| 应用 | 应用于多头注意力参数(小语言模型) |
| 结果 | 调参后的流形方法未决定性地超越 AdamW 基线 |
| 代码 | 已开源 |
| 讨论 | 作者坦率指出:流形优化在 Transformer 低秩参数上的优势不显著——这与上期 PermDoRA(参数空间几何无法解释 LoRA 干扰)结论一致 |
意义:一个”诚实的负面结果”。与上期模块感知流形(Stiefel+DGram 在特定配置下有效)形成对比——流形约束在小语言模型上并非通用的 silver bullet。这也解释了为何上期 Kuramoto Attention 的 1M LM 尽管在流形上运行正常,但规模放大后优势会稀释。
其他方向
| 方向 | 状态 |
|---|---|
| 流形×LLM 交叉 | Riemannian GD for Low-Rank 直接测试(但未胜出);Rethinking Muon 的谱失效也涉及流形几何 |
| 黎曼优化理论 | 本期无新增纯理论 |
| 几何深度学习 | 无新增 |
💡 讨论与趋势
1. Muon 研究进入「精细化修复」阶段
过去三周的发展展现了清晰的演进路径:
| 阶段 | 时间 | 特征 | 代表 |
|---|---|---|---|
| 🧪 变体爆发 | 5月 | 各种 Muon 变体 | Pion, MONA, NuMuon, SPECTRA |
| 📐 理论深化 | 5月底–6月初 | 解释Muon为何有效 | NDS曲率, SoSD, 谱缩放律, Denoise First |
| 🔧 工程化修复 | 6月中 | 修复已知问题 | Zeta(NS条件数), Hyperball(大规模增益衰减) |
| ⚠️ 边界发现 | 6月中下旬 | 揭示失效场景 | Rethinking Muon(VLA/RLVR), Muon^p(微调不宜全抹) |
Zeta + Hyperball + Muon^p + MuCon 四个正交改进理论上可叠加——统一的「超优化器」正在成形。
2. “谱完全白化”教条正在被推翻
从最初的 Muon(全抹平 $UV^\top$)到最新谱系:
- Muon(原始)→ 预训练场景最优
- MuCon → 有界裁剪(裁剪 > 阈值)
- Muon^p → 分数谱幂(部分保留)
- Rethinking Muon → 高通过滤(仅高频正交化)
- PC Layer → 多项式预条件重塑谱
- Zeta → 双白化使正交化更可靠
共识正在形成:谱操作的最优方式因场景而异,一刀切白化仅对预训练有效。
3. Connection:KL-Shampoo 和 Muon 的统一
Pro-KLShampoo 从谱结构证明了 KL-Shampoo 的 Kronecker 预条件和 Muon 的谱正交化本质上是同一数学对象的不同视角。这暗示:
未来优化器设计可能不需要在 Shampoo(昂贵的二阶信息)和 Muon(廉价的零阶正交化)之间做选择——两者可以融合。
4. 流形优化在 LLM 中的前景——仍需谨慎
Riemannian GD for Low-Rank 的负面结果 + PermDoRA 的参数空间几何无效论 + 模块感知流形只在特定配置有效——三条独立证据共同指向:流形约束在小/中规模语言模型上尚未展现压倒性优势。Kuramoto Attention 是否能在大规模下维持优势仍是开放问题。
5. 下期关注
- Hyperball + Zeta 叠加实验——两项正交改进能否叠加
- MGUP 在 >1B 模型上的验证
- Rethinking Muon 的 High-Pass 开源
- Pro-KLShampoo 在更大规模上的验证
- ICML 2026 正式录用名单公布后的论文综述