大模型优化器 & 流形优化日报 — 2026年6月7日

大模型优化器 & 流形优化日报 — 2026年6月7日

🔬 大模型优化器 & 流形优化日报

覆盖日期:2026年6月4日 – 6月7日 上期成功报告:2026年6月4日 本期执行:2026年6月7日 08:00


📌 本期重点

🔥 1. Muon 的核心优势终于得到曲率视角解释(2606.04662)—— Normalized Directional Sharpness (NDS) 是关键

这是首篇从局部曲率角度系统解释「为什么 Muon 比 Adam 好 2×」的理论工作,6月3日提交,MIT/Yale 联合团队:

维度 详情
论文 2606.04662 — 作者:Shuche Wang, Fengzhuo Zhang, Jiaxiang Li, Dirk Bergemann, Zhuoran Yang
核心发现 二阶泰勒展开下,Muon 与 Adam 的一阶增益相当,但 Muon 的二阶曲率惩罚显著更小
关键量 将曲率惩罚分解为 更新范数² × Normalized Directional Sharpness (NDS)。Muon 与 Adam 更新范数相当 → 所以优势来源于更低的 NDS(即更新方向更少触碰尖锐曲率区域)
数据异质性 使用 Zipf-PCFG 可控数据实验 → 数据不平衡放大了 Muon 的 NDS 优势
层间分解 中后期训练中 Muon 的 NDS 优势主要由更小的层内曲率维持
理论部分 在异质曲率二次问题上证明:Muon 通过跨曲率组间均衡分配更新能量获得更小的平均 NDS

🖇 与前几期连接:补齐了「Muon 为何更好」的最后一环。此前已有谱平坦化(机制)、鞍点逃逸(维度无关性)、动量谱滤波(Denoise First),如今曲率视角给出局部几何解释——Muon 的本质优势在于更精准地避开尖锐曲率方向。四者共同构成 Muon 理论的完整图景。

🔥 2. 谱缩放定律(2606.04058)—— Muon 的 NS 迭代在多大模型下会失效?

MIT 团队(Pablo Parrilo, Asuman Ozdaglar)提交于 6月2日,首次系统研究 Muon 的 Newton-Schulz 迭代奇异值谱如何随模型规模缩放:

维度 详情
论文 2606.04058 — Spectral Scaling Laws of Muon
方法 追踪 77M → 2.8B 参数模型中动量缓冲区的奇异值分位数
核心发现 各层奇异值稳定值随模型大小 $M$ 遵循干净幂律缩放
浅-中层 缩放指数约 $M^{-0.25}$ → 学术规模的 5 步 NS 配置在很大规模内仍有效
深层 部分后期层指数高达 $M^{-0.96}$ → 在前沿规模下会进入 NS 失效区间
实用建议 需要按层感知方式选择最小 NS 配置:浅层少迭代、深层多迭代

🖇 与前几期连接:上期 Hua Huang 的 How Much Orthogonalization (2606.00371) 从精度角度回答「多少正交化足够」,本期从规模缩放角度回答「多大模型需要更多 NS 步」。两者互补:一个回答横轴(精度需求),一个回答纵轴(模型规模)。结合起来就是完整的 NS 配置指南。


📊 大模型优化器(仅限前几期未覆盖的新内容)

🟢 PC Layer:多项式权重预条件层(2606.06470)

维度 详情
提交 2026年6月4日 17:55(上期报告之后
作者 Senmiao Wang 等(Ruoyu Sun 组)
核心 提出一个多项式预条件器作为网络层,通过低阶多项式重塑权重矩阵的奇异值谱
双优化器 在 Llama-1B 预训练中同时验证了对 AdamW 和 Muon 的有效性
理论 证明均匀限制每层奇异值可确保深度线性网络的梯度下降几何收敛到全局最小点
零推理开销 训练后预条件器可合并回原始架构
代码 github.com/Empath-aln/PC-layer

意义:PC Layer 是一种「架构侧的谱优化」——不同于 Muon 在优化器中做谱操作、SPECTRA 在更新中做谱裁剪,PC Layer 直接在权重参数化中嵌入谱控制,是优化器-架构协同设计的新方向。

🟢 DoPr:双预条件优化(2606.06418)

维度 详情
提交 2026年6月4日 17:22(上期报告之后
作者 Thomas T. Zhang, Max Simchowitz 等
核心 将梯度级预条件(Adam/Muon)和激活级预条件(KFAC 风格)结合,专门面向「测试时反馈(TTF)」场景
TTF 场景 自回归语言建模、流式生成模型、机器人策略学习——训练用单步损失,部署用 rollout
发现 在 TTF 设置中,测试时性能的提升并不总是伴随验证损失的改善
挑战 挑战了「低验证损失 = 好模型」的传统观念

意义:DoPr 提出了一个新的优化目标范式——为 test-time performance 而非 validation loss 优化。作为 Adam + KFAC 的双预条件组合,也提供了梯度级和激活级两种预条件的协同框架。

🟢 Weight-Space Symmetries:从对称群统一理解 Adam/Muon/Shampoo(2606.00442)

维度 详情
提交 2026年5月30日 — ICML 2026 已接收
作者 Artem Artemev, Felix Dangel 等(MKT / Cambridge)
核心 通过对损失函数保持不变的群作用解析平均,从单梯度构造结构化的 Hessian 近似
统一视角 特定的对称群选择可以恢复 Shampoo/Muon 类的曲率估计
验证 小语言模型上的二阶优化基准测试
代码 github.com/mtkresearch/symm_opt

意义:这是目前最统一的 Hessian 近似框架——将 Adam(对角近似)、Shampoo(块对角)、Muon(正交化)等看似不相关的优化器统一到对称群的选择之下。与上期 SPECTRA(统一谱裁剪)的理念互补:一个从谱出发,一个从对称性出发。

🟢 等变神经网络中的优化器对比研究(2605.27662)

维度 详情
提交 2026年5月26日 — ICML 2026 Workshop on Weight-Space Symmetries
作者 Teodor-Mihai Stupariu, Andrei Manolache
核心 在 ModelNet40 上对比 Muon vs Adam 在多种等变/几何架构上的表现
发现 Muon 在所有架构上一致优于 Adam,且训练出的检查点具有 更高的 Hessian 曲率汇总但更规则的损失景观,权重和表示的稳定秩/有效秩更高

意义:将 Muon × 几何深度学习交叉——在本身就编码了对称性的网络中,Muon 依然优于 Adam,说明 Muon 的优势不是来自替代架构的对称性,而是更基础的优化性质

🟢 Parallax:Muon 解锁注意力架构能力(2605.29157)

维度 详情
提交 2026年5月27日
作者 Yifei Zuo 等(Zhaoran Wang 组)
核心 Parallax 是一种参数化的局部线性注意力(LLA)机制,在 0.6B / 1.7B 规模预训练中验证
关键发现 Muon 解锁了 Parallax 的容量潜能——使用 AdamW 时 Parallax 没有优势,切换到 Muon 后才有持续困惑度改善
意义 这是首个明确展示架构-优化器协同设计(architecture-optimizer co-design)的实证工作

🖇 与前几期连接:与本期 PC Layer 形成呼应——两者都指向 Muon 对架构设计的解锁效应。Muon 不仅自身是更好的优化器,还可能改变什么样的架构设计是有效的。

📊 新论文一览

论文 ID 日期 方向 意义
PC Layer 2606.06470 6/4 架构侧谱预条件 静态谱控制 × AdamW+Muon
DoPr 2606.06418 6/4 双预条件优化 Adam+KFAC,面向TTF场景
Muon Curvature 2606.04662 6/3 曲率解释 首篇NDS理论,补齐Muon解释
Spectral Scaling 2606.04058 6/2 NS缩放律 规模依赖的NS配置指南
Weight Symmetry 2606.00442 5/30 统一框架 对称群统一Adam/Muon/Shampoo
Equivariant Muon 2605.27662 5/26 跨界验证 Muon优于Adam在所有等变架构
Parallax 2605.29157 5/27 架构协同 Muon解锁注意力新设计

🔄 流形优化(仅限前几期未覆盖的新内容)

🟢 知识流形:文档语义的黎曼几何框架(2606.05907)

维度 详情
提交 2026年6月4日
作者 Tomonaga Okabe, Kazuhiko Komatsu
核心 构建「知识流形」:用 n-gram TF-IDF 表示将文档排列在黎曼几何空间中,通过测地线分析揭示语义关系

与优化器的关联:间接。该工作将语义空间建模为流形,与 NN 梯度流在子流形上的黎曼几何(此前 2605.27779)共享「几何化表示」的理念。

🟢 黎曼随机优化用于充分降维(2606.00413)

维度 详情
提交 2026年5月29日
作者 Thibault Pautrel, François Portier
核心 在 Grassmann 流形上做随机优化用于充分降维(SDR)——减少环境维度的诅咒,同时保证统计效率

与LLM的连接:Grassmann 流形同时也是 iMuon(上期重点)的关键流形类型之一。该工作的随机优化理论可能间接应用于流形参数的优化器设计。

🔄 流形优化方向总结

本期流形优化方向无重大新突破——没有像上期 iMuon 那样的流形 × LLM 交叉工作。上述两篇论文均属于应用方向的扩展而非优化器本身。与 LLM 训练直接相关的流形优化研究成果(iMuon, Riemannian Hadamard 等)已在上期完整报道。


💡 讨论与趋势

1. 本期主题:Muon 理论从「是什么」过渡到「为什么」

从本期论文集合可以清晰看出:

阶段 代表论文 问题
5月:是什么 原始 Muon、各种变体 Muon 比 Adam 好?
6月初:为什么 Curvature (NDS)、Spectral Scaling、Denoise First 为什么好?何时失效?
6月初:统一化 Weight Symmetry、SPECTRA 如何将 Adam/Muon/Shampoo 统一?

尤其是 Curvature Perspective(2606.04662) 这篇论文,回答了社区最关心的问题——「Muon 为什么更快?」——用 NDS 这个可计算、可分解的量给出了局部几何解释,是 Muon 理论发展的分水岭论文。

2. NS 迭代的规模制约浮出水面

Spectral Scaling Laws(2606.04058)的铁律令人警醒:部分深层在 $M^{-0.96}$ 的指数下意味着标准化规模的 2 倍增加就会导致奇异值减半,迫使使用更多的 NS 迭代。这是一个随着模型扩大而自然增长的隐性成本——在上期之前社区对此完全没有意识到。

3. 架构-优化器协同设计(Co-Design)成为新趋势

工作 协同方式
PC Layer 架构增加谱预条件层,优化器保持不动
Parallax 注意力架构的设计只有在 Muon 下才有效
DoPr 优化器设计针对 TTF 场景的架构反馈模式
Weight Symmetry 理论框架揭示优化器选择 = 对称性假设的选择

这四条不同的路径都指向同一个方向:架构和优化器不能再被独立设计

4. iMuon 后续追踪

上期重点 iMuon(2605.09238)在本期间内尚未见到来自其他团队的复现或扩展 work,但其 GitHub 仓库(github.com/1bang118/manifold-intrinsic-muon)值得持续关注。


📋 数据来源

来源 检索方式 获取新论文数
arXiv cs.LG (Muon/optimizer关键词) API搜索 + 全文扫描 7篇未报道
arXiv (Riemannian/manifold/optimization) API搜索 + 全文扫描 2篇(非优化器核心)
交叉验证 与上两期日报对比排除已报道
Google/DDG 搜索补充 社区讨论/新闻 未发现重大社区讨论

📦 存档记录

  • 文件名2026-06-07-llm-optimizer-manifold-daily.md
  • 关联上期2026-06-04-llm-optimizer-manifold-daily.md
  • 下期预告:下次执行 2026-06-10。重点关注:PC Layer 和 DoPr 的社区反响;Spectral Scaling Laws 对 Muon 社区的影响;是否有团队跟进 iMuon 在大模型上的实证;以及 6月中旬 arXiv 新提交的启动。