大模型优化器 & 流形优化日报 — 2026年6月28日
大模型优化器 & 流形优化日报 — 2026年6月28日
🔬 大模型优化器 & 流形优化日报
覆盖日期:2026年6月25日 – 6月28日 上期成功报告:2026年6月25日 本期执行:2026年6月28日 08:00
📌 本期重点
🔥 1. DMuon:分布式 Muon 实现,开销降至接近 AdamW 水平(2606.27153)
| 维度 | 详情 |
|---|---|
| 论文 | 2606.27153 |
| 提交 | 2026年6月25日 |
| 作者 | Vincent Chen, Starrick Liu, Regis Cheng, Dance Yang 等(11位) |
| 核心问题 | Muon 的 Newton-Schulz 迭代导致优化器开销超过前向+反向传播总和的 2倍,现有分布式训练基础设施与矩阵级优化器不兼容 |
| 方案 | DMuon:开源分布式 Muon 实现,作为即插即用模块集成到现有训练流水线,无需框架级修改 |
| 效果 | 端到端单步时间加速 1.48×–3.01×;优化器步时间加速 6.85×–163.00×;延迟降至接近 AdamW 水平 |
| 验证 | 在 embodied foundation model 和 LLM 训练上验证 |
| 意义 | ⭐ 这是 Muon 走向大规模实用的关键工程突破——之前 Muon 虽然在理论和小规模上表现出色,但高分布式开销是实际部署的最大障碍。DMuon 直接扫除了这个障碍。 |
🔥 2. HiMuon:分块 Newton-Schulz 提升 Muon 效率(2606.27216)
| 维度 | 详情 |
|---|---|
| 论文 | 2606.27216 |
| 提交 | 2026年6月25日 |
| 核心洞察 | 全矩阵 Newton-Schulz 的计算复杂度为 $O(r^2 s K)$,耦合所有行列。但实践中相邻权重矩阵的谱结构可能允许局部化处理 |
| 方案 | Hierarchical Muon (HiMuon):将动量梯度矩阵划分为 $T \times T$ 的分块,独立对每块应用 Newton-Schulz 映射,然后重新组装 |
| 复杂度 | 从 $O(r^2 s K)$ 降至 $O(H W T K)$,分块越小提升越大 |
| 工程优势 | 支持分块大小相关的 GPU kernel、跨层批处理、内存受限分块和运行时调度 |
| 效果 | Transformer 训练实验中保持接近全矩阵 Muon 的训练行为,同时显著提升效率 |
| 与 DMuon 的关系 | 正交可叠加——DMuon 解决分布式通信开销,HiMuon 降低单步计算开销 |
⚡ 本期两篇 Muon 工程化论文同时出现(6/25),标志着 Muon 从「理论验证」进入「工程部署」阶段。
📊 大模型优化器(仅限此前未覆盖的新内容)
🟢 Tensorion:将 Muon 的矩阵约束优化推广到高阶张量(2606.25975)
| 维度 | 详情 |
|---|---|
| 论文 | 2606.25975 |
| 提交 | 2026年6月24日 |
| 核心 | Adam 等优化器将每个参数块视为无结构向量,忽略了现代模型中的多重线性权重结构。Muon 利用了矩阵的谱范数约束。Tensorion 将这一约束优化视角从矩阵推广到高阶张量 |
| 方法 | 基于张量范数球的线性最小化 Oracle(LMO),范数选择在张量谱范数紧界和LMO 可计算性之间取得平衡。LMO 简化为对自适应选择展开矩阵的操作 |
| 退化性 | 限制到 2 阶张量(矩阵)时,完全退化回 Muon |
| 实证 | 在基于张量的计算机视觉任务上,相比 Adam 和现有张量感知基线,收敛更优、梯度更新更稳定 |
| 意义 | 这是 Muon 从矩阵到张量的自然推广——卷积层、张量分解层等更复杂的权重结构将从中受益 |
🟢 MD Decoupling:解耦权重向量的幅度与方向——消除权重衰减和 Warmup 需求(2606.25971)
| 维度 | 详情 |
|---|---|
| 论文 | 2606.25971 |
| 提交 | 2026年6月24日 |
| 核心洞察 | 每个权重矩阵携带两个不同量——幅度(magnitude)和方向(direction)。Adam 和 Muon 都将它们耦合更新:方向变化依赖当前幅度,幅度变化是学习方向的副产品。两者都不直接受学习率控制 |
| 方案 | MD Decoupling:将每个权重分解为超球面上的固定范数方向和可学习的逐行/逐列幅度增益,使用不同的学习率更新。模型仍然看到单一的融合权重张量 |
| 效果 | 1️⃣ 消除权重衰减和 warmup 需求 2️⃣ 兼容 Adam 和 Muon,均优于精心调参的基线 3️⃣ 学习率在模型宽度变化时无需重调即可迁移 4️⃣ 在大规模 MoE 模型上仍有效 |
| 意义 | ⭐ 这是优化器设计的结构性改进——并非提出新优化器,而是指出所有现有优化器都耦合了幅度和方向,解耦后训练动态更可预测、更简单。与 DMuon/HiMuon 正交可叠加 |
🟢 其他新发现
| 方向 | 论文 | ID | 日期 | 一句话 |
|---|---|---|---|---|
| 优化理论 | Blackwell Approachability = Gradient Equilibrium(Michael I. Jordan 等) | 2606.27315 | 6/25 | 证明 GEQ(梯度均衡)与 Blackwell 可逼近性等价,进而等价于遗憾最小化和校准——这是在线优化理论的重大统一 |
| 二阶优化 | Multiobjective Composite Optimization: Second-order Methods | 2606.26792 | 6/25 | 多目标复合优化的二阶方法,含预条件策略和子空间变体 |
| GPU 优化器 | χsao:GPU 原生并行黑箱函数优化器 | 2606.26164 | 6/24 | 利用收敛-反收敛振荡循环逃离局部陷阱,42个基准函数上 $d \geq 8$ 时 100% 模式恢复,加速比最高 34–39× |
| LLM 后训练 | RiVER:无需真实解即可在基于分数的优化任务上训练 LLM | 2606.27369 | 6/25 | 校准奖励塑造和基于排名的比较,AtCoder/ALE-Bench 平均提升 8.9%–9.4% |
| RL 训练系统 | RolloutPipe:分离式在策略 LLM RL 中流水线化 Rollout 与训练 | 2606.26997 | 6/25 | 完整组流水线 + 前沿组分派,缩短 rollout 到训练结束时间 30.7%–42.3% |
🟢 SOAP / Shampoo / AdamW 方向
本期无新增内容。 自 Pro-KLShampoo 和 LoRA-Muon 后,SOAP 和 Shampoo 家族进入静默期。
🟢 工具与生态更新
| 项目 | 说明 |
|---|---|
| SOAP_JAX | ⭐27,SOAP 优化器的 JAX 实现(haydn-jones,最新更新 1月) |
| quick-optimizer-test-nanogpt | ⭐2,在 nanoGPT 上对 AdamW/Adam-mini/Muon/SOAP 等优化器进行即插即用基准测试 |
| mctorch | ⭐254,面向深度学习的流形优化库(但自 2021 年起未活跃更新) |
🔄 流形优化(仅限此前未覆盖的新内容)
本期无新增论文
过去3天 arXiv 上没有出现新的流形优化/黎曼几何/几何深度学习方向的新论文。
- 流形优化 × LLM 交叉:无新论文
- 黎曼优化理论:无新论文(上次新工作是 6/18 的 Lie-Algebra Attention 和 Fisher-Geometric Sharpness)
- 几何深度学习:无新论文
值得注意的是:本期 Tensorion(2606.25975)将 Muon 推广到高阶张量,其核心是基于张量范数球的线性最小化 Oracle,跟流形优化有一定的理论亲缘性。此外,MD Decoupling 的「方向在超球面上」设定本质上也是流形上的优化问题。
趋势观察:从流形/几何视角改进优化器的思路正在被 Muon 社区吸收和消化。近期 Muon 的改进(AngularMuown, MD Decoupling, Tensorion)都带有几何优化印记,但都以「优化器改进」而非「流形优化新方法」的形式发表。交叉方向仍处于「被吸收」阶段,而非独立爆发期。
💡 讨论与趋势
1. 「Muon 工程化双响炮」——本周核心主题
本期(6/25-6/28)最突出的信号是 Muon 的工程化而非理论突破:
| 维度 | 此前瓶颈 | 本期突破 |
|---|---|---|
| 分布式开销 | Muon 优化器步耗时是前向+反向的 2 倍以上 | DMuon:降至接近 AdamW 水平(加速 1.48–3.01× 端到端,6.85–163× 优化器步) |
| 单步计算 | Newton-Schulz 全矩阵耦合,$O(r^2 s K)$ | HiMuon:分块后 $O(H W T K)$,支持 GPU kernel 优化 |
| 优化器结构 | 幅度/方向耦合,依赖 weight decay + warmup 间接调节 | MD Decoupling:直接解耦,消除 weight decay 和 warmup 需求 |
| 推广到张量 | 仅支持矩阵权重 | Tensorion:扩展到任意高阶张量 |
信号清晰:Muon 在经过 3-4 月的理论爆发(Schattor, Pro-KLShampoo, 收敛理论等)后,正在进入实用的工程部署阶段。
2. DMuon vs HiMuon:正交可叠加
- DMuon 解决的是分布式训练中的通信和同步开销
- HiMuon 解决的是单步中的矩阵计算复杂度
- 两者完全正交,可以同时使用
这意味着未来 Muon 的实用部署将同时受益于这两项改进。
3. MD Decoupling:一个「显而易见但没人做」的改进
MD Decoupling 的洞察很简洁——权重矩阵的幅度和方向被所有现有优化器耦合处理。解耦后不仅性能提升,还消除了 weight decay 和 warmup 这两个依赖深度经验的调参组件,让训练更可预测。
这反映了 Muon 社区的一个趋势:不满足于提出新优化器,而是重新审视优化器的基本设计假设。
4. Blackwell = Gradient Equilibrium:在线学习大统一
Michael I. Jordan 等人(2606.27315)证明 GEQ 等价于 Blackwell 可逼近性,进而等价于遗憾最小化和校准。这是在线优化理论的一次重大统一。虽然不太直接改变 LLM 训练实践,但为理解在线学习框架提供了统一的数学基础。
5. 流形优化的静默期
延续上期判断,流形优化方向仍在静默期。但 Tensorion 和 MD Decoupling 中涉及的几何视角表明,流形优化的思想正在被「内化」到主流优化器设计中。这种内化可能意味着:未来几周出现新流形优化方法的概率降低,但出现更多受流形启发的优化器改进的概率升高。
6. 下期关注
- DMuon 代码仓库是否公开以及社区的采用情况
- HiMuon + DMuon 组合在大规模训练中的实测数据
- MD Decoupling 在更大模型(10B+)上的验证
- Tensorion 在卷积/张量分解模型上的实证
- 7月初是否有新投稿(arXiv 每周一窗口效应)