大模型优化器 & 流形优化日报 — 2026年6月28日

大模型优化器 & 流形优化日报 — 2026年6月28日

🔬 大模型优化器 & 流形优化日报

覆盖日期:2026年6月25日 – 6月28日 上期成功报告:2026年6月25日 本期执行:2026年6月28日 08:00


📌 本期重点

🔥 1. DMuon:分布式 Muon 实现,开销降至接近 AdamW 水平(2606.27153)

维度 详情
论文 2606.27153
提交 2026年6月25日
作者 Vincent Chen, Starrick Liu, Regis Cheng, Dance Yang 等(11位)
核心问题 Muon 的 Newton-Schulz 迭代导致优化器开销超过前向+反向传播总和的 2倍,现有分布式训练基础设施与矩阵级优化器不兼容
方案 DMuon:开源分布式 Muon 实现,作为即插即用模块集成到现有训练流水线,无需框架级修改
效果 端到端单步时间加速 1.48×–3.01×;优化器步时间加速 6.85×–163.00×;延迟降至接近 AdamW 水平
验证 在 embodied foundation model 和 LLM 训练上验证
意义 这是 Muon 走向大规模实用的关键工程突破——之前 Muon 虽然在理论和小规模上表现出色,但高分布式开销是实际部署的最大障碍。DMuon 直接扫除了这个障碍。

🔥 2. HiMuon:分块 Newton-Schulz 提升 Muon 效率(2606.27216)

维度 详情
论文 2606.27216
提交 2026年6月25日
核心洞察 全矩阵 Newton-Schulz 的计算复杂度为 $O(r^2 s K)$,耦合所有行列。但实践中相邻权重矩阵的谱结构可能允许局部化处理
方案 Hierarchical Muon (HiMuon):将动量梯度矩阵划分为 $T \times T$ 的分块,独立对每块应用 Newton-Schulz 映射,然后重新组装
复杂度 从 $O(r^2 s K)$ 降至 $O(H W T K)$,分块越小提升越大
工程优势 支持分块大小相关的 GPU kernel、跨层批处理、内存受限分块和运行时调度
效果 Transformer 训练实验中保持接近全矩阵 Muon 的训练行为,同时显著提升效率
与 DMuon 的关系 正交可叠加——DMuon 解决分布式通信开销,HiMuon 降低单步计算开销

本期两篇 Muon 工程化论文同时出现(6/25),标志着 Muon 从「理论验证」进入「工程部署」阶段。


📊 大模型优化器(仅限此前未覆盖的新内容)

🟢 Tensorion:将 Muon 的矩阵约束优化推广到高阶张量(2606.25975)

维度 详情
论文 2606.25975
提交 2026年6月24日
核心 Adam 等优化器将每个参数块视为无结构向量,忽略了现代模型中的多重线性权重结构。Muon 利用了矩阵的谱范数约束。Tensorion 将这一约束优化视角从矩阵推广到高阶张量
方法 基于张量范数球的线性最小化 Oracle(LMO),范数选择在张量谱范数紧界LMO 可计算性之间取得平衡。LMO 简化为对自适应选择展开矩阵的操作
退化性 限制到 2 阶张量(矩阵)时,完全退化回 Muon
实证 在基于张量的计算机视觉任务上,相比 Adam 和现有张量感知基线,收敛更优、梯度更新更稳定
意义 这是 Muon 从矩阵到张量的自然推广——卷积层、张量分解层等更复杂的权重结构将从中受益

🟢 MD Decoupling:解耦权重向量的幅度与方向——消除权重衰减和 Warmup 需求(2606.25971)

维度 详情
论文 2606.25971
提交 2026年6月24日
核心洞察 每个权重矩阵携带两个不同量——幅度(magnitude)和方向(direction)。Adam 和 Muon 都将它们耦合更新:方向变化依赖当前幅度,幅度变化是学习方向的副产品。两者都不直接受学习率控制
方案 MD Decoupling:将每个权重分解为超球面上的固定范数方向和可学习的逐行/逐列幅度增益,使用不同的学习率更新。模型仍然看到单一的融合权重张量
效果 1️⃣ 消除权重衰减和 warmup 需求 2️⃣ 兼容 Adam 和 Muon,均优于精心调参的基线 3️⃣ 学习率在模型宽度变化时无需重调即可迁移 4️⃣ 在大规模 MoE 模型上仍有效
意义 这是优化器设计的结构性改进——并非提出新优化器,而是指出所有现有优化器都耦合了幅度和方向,解耦后训练动态更可预测、更简单。与 DMuon/HiMuon 正交可叠加

🟢 其他新发现

方向 论文 ID 日期 一句话
优化理论 Blackwell Approachability = Gradient Equilibrium(Michael I. Jordan 等) 2606.27315 6/25 证明 GEQ(梯度均衡)与 Blackwell 可逼近性等价,进而等价于遗憾最小化和校准——这是在线优化理论的重大统一
二阶优化 Multiobjective Composite Optimization: Second-order Methods 2606.26792 6/25 多目标复合优化的二阶方法,含预条件策略和子空间变体
GPU 优化器 χsao:GPU 原生并行黑箱函数优化器 2606.26164 6/24 利用收敛-反收敛振荡循环逃离局部陷阱,42个基准函数上 $d \geq 8$ 时 100% 模式恢复,加速比最高 34–39×
LLM 后训练 RiVER:无需真实解即可在基于分数的优化任务上训练 LLM 2606.27369 6/25 校准奖励塑造和基于排名的比较,AtCoder/ALE-Bench 平均提升 8.9%–9.4%
RL 训练系统 RolloutPipe:分离式在策略 LLM RL 中流水线化 Rollout 与训练 2606.26997 6/25 完整组流水线 + 前沿组分派,缩短 rollout 到训练结束时间 30.7%–42.3%

🟢 SOAP / Shampoo / AdamW 方向

本期无新增内容。 自 Pro-KLShampoo 和 LoRA-Muon 后,SOAP 和 Shampoo 家族进入静默期。

🟢 工具与生态更新

项目 说明
SOAP_JAX ⭐27,SOAP 优化器的 JAX 实现(haydn-jones,最新更新 1月)
quick-optimizer-test-nanogpt ⭐2,在 nanoGPT 上对 AdamW/Adam-mini/Muon/SOAP 等优化器进行即插即用基准测试
mctorch ⭐254,面向深度学习的流形优化库(但自 2021 年起未活跃更新)

🔄 流形优化(仅限此前未覆盖的新内容)

本期无新增论文

过去3天 arXiv 上没有出现新的流形优化/黎曼几何/几何深度学习方向的新论文。

  • 流形优化 × LLM 交叉:无新论文
  • 黎曼优化理论:无新论文(上次新工作是 6/18 的 Lie-Algebra Attention 和 Fisher-Geometric Sharpness)
  • 几何深度学习:无新论文

值得注意的是:本期 Tensorion(2606.25975)将 Muon 推广到高阶张量,其核心是基于张量范数球的线性最小化 Oracle,跟流形优化有一定的理论亲缘性。此外,MD Decoupling 的「方向在超球面上」设定本质上也是流形上的优化问题。

趋势观察:从流形/几何视角改进优化器的思路正在被 Muon 社区吸收和消化。近期 Muon 的改进(AngularMuown, MD Decoupling, Tensorion)都带有几何优化印记,但都以「优化器改进」而非「流形优化新方法」的形式发表。交叉方向仍处于「被吸收」阶段,而非独立爆发期。


💡 讨论与趋势

1. 「Muon 工程化双响炮」——本周核心主题

本期(6/25-6/28)最突出的信号是 Muon 的工程化而非理论突破:

维度 此前瓶颈 本期突破
分布式开销 Muon 优化器步耗时是前向+反向的 2 倍以上 DMuon:降至接近 AdamW 水平(加速 1.48–3.01× 端到端,6.85–163× 优化器步)
单步计算 Newton-Schulz 全矩阵耦合,$O(r^2 s K)$ HiMuon:分块后 $O(H W T K)$,支持 GPU kernel 优化
优化器结构 幅度/方向耦合,依赖 weight decay + warmup 间接调节 MD Decoupling:直接解耦,消除 weight decay 和 warmup 需求
推广到张量 仅支持矩阵权重 Tensorion:扩展到任意高阶张量

信号清晰:Muon 在经过 3-4 月的理论爆发(Schattor, Pro-KLShampoo, 收敛理论等)后,正在进入实用的工程部署阶段

2. DMuon vs HiMuon:正交可叠加

  • DMuon 解决的是分布式训练中的通信和同步开销
  • HiMuon 解决的是单步中的矩阵计算复杂度
  • 两者完全正交,可以同时使用

这意味着未来 Muon 的实用部署将同时受益于这两项改进。

3. MD Decoupling:一个「显而易见但没人做」的改进

MD Decoupling 的洞察很简洁——权重矩阵的幅度和方向被所有现有优化器耦合处理。解耦后不仅性能提升,还消除了 weight decay 和 warmup 这两个依赖深度经验的调参组件,让训练更可预测。

这反映了 Muon 社区的一个趋势:不满足于提出新优化器,而是重新审视优化器的基本设计假设

4. Blackwell = Gradient Equilibrium:在线学习大统一

Michael I. Jordan 等人(2606.27315)证明 GEQ 等价于 Blackwell 可逼近性,进而等价于遗憾最小化和校准。这是在线优化理论的一次重大统一。虽然不太直接改变 LLM 训练实践,但为理解在线学习框架提供了统一的数学基础。

5. 流形优化的静默期

延续上期判断,流形优化方向仍在静默期。但 Tensorion 和 MD Decoupling 中涉及的几何视角表明,流形优化的思想正在被「内化」到主流优化器设计中。这种内化可能意味着:未来几周出现新流形优化方法的概率降低,但出现更多受流形启发的优化器改进的概率升高。

6. 下期关注

  1. DMuon 代码仓库是否公开以及社区的采用情况
  2. HiMuon + DMuon 组合在大规模训练中的实测数据
  3. MD Decoupling 在更大模型(10B+)上的验证
  4. Tensorion 在卷积/张量分解模型上的实证
  5. 7月初是否有新投稿(arXiv 每周一窗口效应)