大模型优化器 & 流形优化日报 — 2026年6月16日

大模型优化器 & 流形优化日报 — 2026年6月16日

🔬 大模型优化器 & 流形优化日报

覆盖日期:2026年6月13日 – 6月16日 上期成功报告:2026年6月13日 本期执行:2026年6月16日 08:00


📌 本期重点

🔥 1. Zeta:双白化矩阵优化——修复 Muon 的 NS 迭代脆弱性(2606.14187)

维度 详情
论文 2606.14187 — Kaiwen Chen, Shuhai Zhang, Mingkui Tan 等(华南理工)
提交 2026年6月12日
核心洞察 Muon 的 Newton-Schulz 迭代有一个被忽视的弱点:严重依赖输入条件数,而原始动量矩阵在各个坐标维度上存在严重的尺度异质性
验证 通过卡方均匀性检验证明:Transformer 各层普遍存在矩阵内部尺度不均衡,坐标白化可以有效校正
方法 Zeta 提出有序双白化流水线:坐标白化(Coordinate Whitening)→ 谱白化(Spectral Whitening),先建立统计各向同性→再可靠执行正交化
理论 严格证明双流水线通过改善输入条件数,显著降低正交化误差
实证 0.6B–8B 参数语言建模、MoE 架构、视觉任务——匹配或超越 Muon 基线,收敛更快、泛化更好
代码 https://gitcode.com/kevin259/MindSpeed

意义:直接回答了上期 Muon^p 和过去 Spectral Scaling Laws 共同发现的问题——Muon 的 NS 迭代在大规模下表现不稳定。Zeta 从输入条件数入手,用坐标白化+谱白化的有序组合系统性解决了这个工程瓶颈,是 Muon 工程化的重要进步。

🔥 2. Free Heavy-Tailed Lunch for Muon——Suvrit Sra 团队理论证明 Muon 最优(2606.14560)

维度 详情
论文 2606.14560 — Florian Hübler, Thomas Pethick, Suvrit Sra(MIT/TU Munich)
提交 2026年6月12日
核心 在重尾非凸随机优化框架下,首个严格证明 Muon 在核范数平稳度量下达到最优样本复杂度
关键定理 对 $m\times n$ 矩阵,Muon 在核范数中找 $\varepsilon$-稳定点只需 $\mathcal{O}\left(\min{m,n} \frac{\Delta_1 L}{\varepsilon^2} \left(\frac{\sigma}{\varepsilon}\right)^{\frac{p}{p-1}}\right)$ 个样本,吸收重尾噪声而无额外维度依赖
对比 欧几里得方法在相同平稳度量下需要额外维度依赖的成本
惊喜发现 结论暗示其他 Schatten 几何(而不只是 Muon 的谱几何)在某些设置下也能取得有竞争力性能
实证 在 LLM 上验证了理论预期

意义:Suvrit Sra(MIT 优化理论大牛)的团队为 Muon 的卓越实证表现提供了最严格的样本复杂度理论证明——此前所有理论工作(NDS 曲率、谱动力学、熵最大化)都是从「为什么好」角度分析,而该工作从「最优性」角度证明了 Muon 在重尾噪声场景下理论上不可超越


📊 大模型优化器(仅限新内容)

🟢 Gefen:~8x 内存压缩的 AdamW 替代品(2606.13894,6月11日)

维度 详情
作者 Nadav Benedek, Tomer Koren, Ohad Fried(Tel Aviv University)
核心 AdamW 的一阶/二阶矩占用约 2× 参数量内存 → Gefen 通过 自动块级共享二矩 + 学习码本量化一矩 将内存压缩 ~8x
节省 6.5 GiB / billion parameters,在 FSDP/DDP 下可直接换大 batch
理论动机 大混合 Hessian 项会将参数约束到相似的梯度平方比 → Hessian 对齐的参数自然适合共享二矩统计量
实践 从初始梯度平方推断块结构,无需架构元数据——真正的即插即用
代码 github.com/ndvbd/Gefen ⭐17,含 fused CUDA JIT 核

意义:如果 Gefen 能在广泛实验中被验证,它将直接解决大模型训练中 AdamW 内存开销的第一性瓶颈。与 Muon 系列正交——可以叠加使用。

🟢 Muon^p:分数谱幂——何时应保留而非抹平奇异值?(2606.13867,6月11日)

维度 详情
作者 Yihe Dong, Will Sawin
核心 Muon 用 $UV^\top$ 完全抹平奇异值谱 → 但有时保留谱信息更重要 → 提出 $US^pV^\top$($p\in(0,1)$ 有理数),在 Muon 和 GD 之间插值
理论障碍 证明分数谱幂不能通过任何固定单变量多项式迭代计算 → 推导低次奇双变量递归逼近,保持 Muon 的矩阵乘法结构
最优性 在 Schatten $q$-范数下($q=1+1/p$)最大化损失线性改善
实证 微调场景特别有效(亿级模型上验证困惑度和下游任务改善)
局限性 分析了何时不适合保留谱(通过谱几何)

意义:Muon^p 与上期 LoRA-Muon 在「如何在不同场景下处理谱」上有互补性——LoRA-Muon 回答了低秩流形上的谱处理,Muon^p 回答了全秩时的部分谱保留。两者共同指向一个结论:一刀切的完全谱抹平并非最优策略

🟢 Beyond a Single Explanation of the Adam–SGD Gap(2606.14259,6月12日)

维度 详情
作者 Chenxiang Zhang, Rustem Islamov 等(多机构)
范围 跨视觉、语言、基因组学、图任务,覆盖现代和经典架构,受控实证研究
核心发现 没有单一因素能一致解释 Adam–SGD 差距:(1) 均匀词汇分布下差距持续,重尾分布下消失;(2) softmax-attention 模型中 SGD 反超 Adam;(3) ReLU → GeLU 等软修改放大差距
关键模式 发现一个 「交叉批大小」(crossover batch size)——随批大小扩大,优势从 SGD 转向 Adam
理论模型 捕获了这一批大小依赖的交叉现象,调和多个现有假说

意义:在 Muon 席卷一切的今天,这篇论文提醒我们 Adam vs. SGD 的最基本问题至今没有统一答案——更不用说 Adam vs. Muon 了。batch-size 交叉现象可能为理解 Muon 的批大小依赖提供线索。

🟢 Denoise First, Orthogonalize Later(2606.03899,6月2日)——补报

维度 详情
作者 Xianliang Li, Zihan Zhang, Weiyang Liu, Han Bao
核心 首次系统证明 Muon 中的动量扮演谱滤波器角色:在结构化信号+扰动梯度模型下,动量压制扰动、保留主导信号、扩大谱间隙
关键结论 先做动量再做正交化,比反向顺序或去掉动量,对信号对齐有可证明更强的效果
实验 在 LLM 预训练等任务上验证了理论
为何补报 该文为理解『为何 Muon 中的 momentum 有效』提供了最干净的解释,但与上期报告中已涵盖的 Poggio 谱动力学不冲突——前者从熵角度,这里从谱滤波角度

📊 新论文一览

论文 ID 日期 方向 核心贡献
Zeta 2606.14187 6/12 Muon 工程修复 双白化解决 NS 条件数依赖,0.6B-8B 验证
Free Heavy-Tailed Lunch 2606.14560 6/12 Muon 理论最优性 核范数平稳下样本复杂度最优,无法被超越
Gefen 2606.13894 6/11 内存优化 AdamW 8x 内存压缩,CUDA 实现已开源
Muon^p 2606.13867 6/11 谱插值优化 分数谱幂保留奇异值信息,微调特别有效
Adam-SGD Gap 2606.14259 6/12 基础理解 无单因素解释差距,发现交叉批大小
Denoise First(补报) 2606.03899 6/2 Muon 动量理论 动量=谱滤波器,先滤波后正交化更强

🔄 流形优化(仅限前几期未覆盖的新内容)

🟢 Kuramoto Attention:在圆环面上的自注意力同步(2606.11585,6月10日)

维度 详情
作者 Joshua Nunley(独立作者)
核心 将自注意力的每个隐藏坐标定义为角度(属于圆环面 $S^1$),注意力加权圆环面均值更新正好等于 Kuramoto 耦合项 $\sum_u A_{t,u}\sin(\theta_u-\theta_t)$
数学优雅性 紧致群上只需两个要素:不变相似度得分 + 流形上均值运算 → 环面是阿贝尔群情况,两者都有闭式解
RoPE 连接 旋转位置编码自然成为得分中的位置相关相位漂移
实证 enwiki8 字符级 LM:1M 参数量下 BPC $1.637\pm0.010$,匹配 SwiGLU 基线的 $1.616\pm0.004$;5M 参数中位数持平
结论 流形约束几何结构在~百万参数量级上可作为功能正常的语言模型

意义:这不是一篇优化器论文,而是一篇将注意力机制重新理解为流形上同步过程的架构工作。从优化器视角看:如果在 Kuramoto attention 上训练,反向传播通过 sin/cos 的梯度计算与标准注意力截然不同——这可能自然契合 Muon 的谱更新风格(因为参数在圆环面上自然有界)。

🟢 PermDoRA——参数空间几何无法解释 LoRA 干扰(2606.11262,6月9日)

维度 详情
作者 Gowtham Sivaramakrishnan 等
核心 在 LLaMA-3.1-8B / Mistral-7B 上用 DoRA-RBAC 框架测试:黎曼启发式合并(Frêchet 均值平均化)不优于标准平均
诊断 适配器更新的角度对齐和正交性与合并性能弱相关
结论 适配器干扰不由参数空间几何主导——而是共享非线性表示的交互

意义:对上期模块感知流形分配(Attention=Stiefel + MLP=DGram)形成对照——该文表明参数空间的几何约束不是万能的,干扰主要发生在表示空间而非权重空间。

🟢 Riemannian Metric Matching(2606.14334,6月12日)

维度 详情
作者 Jacob Bamberger, Adam Gosztolai, Pierre Vandergheynst, Michael Bronstein
核心 用黎曼度量匹配从高维数据样本中可扩展地估计内在几何
方法 避免传统图/核方法的 $\mathcal{O}(N^2)$ 扩展瓶颈
适用 高维数据集的几何建模(与优化器不直接相关,属于流形学习工具)

其他方向

方向 状态
几何深度学习 Kuramoto Attention(上)为架构层级的流形应用
流形×LLM 交叉 本期无新增直接交叉论文。PermDoRA 从反面给出经验约束——参数空间几何不主导干扰
Riemannian 优化理论 Riemannian Metric Matching 是流形学习工具,非优化器理论
iMuon(2605.09238) 无社区复现更新

💡 讨论与趋势

1. Muon 研究的「工程化转向」

阶段 时间 特征 代表
🧪 变体爆发 5月 各种 Muon 变体满天飞 Pion, MONA, NuMuon, SPECTRA
📐 理论深化 5月底-6月初 解释「为什么好」 NDS 曲率, Poggio 熵, 谱缩放律
🔧 工程化修复 本期 修复已知问题→让 Muon 在大规模下可靠 Zeta(修复 NS 条件数), Denoise First(理解动量)

Zeta 的出现在标志性意义上非常重要:Muon 社区正在从「发明新变体」转向「修复工程缺陷」。Zeta 直接定位了 NS 迭代在大规模下的脆弱性并给出了系统解。

2. 「保留谱」思潮兴起——Muon^p 与 LoRA-Muon 的互补信号

工作 做什么 应用场景
Muon(原始) 完全抹平谱 → $UV^\top$ 预训练
Muon^p(本期) 部分保留谱 → $US^pV^\top$, $p\in(0,1)$ 微调
LoRA-Muon(上期) 低秩流形上谱最陡下降 LoRA 微调

三者形成一条完整谱线:预训练要抹平→微调要部分保留→LoRA 要低秩谱最陡下降。这是一个值得关注的模式。

3. 内存优化器进入「即插即用」阶段

Gefen(已开源 PyPI + fused CUDA)直接将 AdamW 内存压至 1/8,且声称与 AdamW 性能持平。与之前在 5 月份报道的 PowerStep、GaLore 等内存优化方法相比,Gefen 的可部署性明显更高。

4. Kuramoto Attention:Attention 的「流形几何化」信号

虽然只是一篇独立作者的探索性工作,但 1M 参数语言模型在流形约束下功能正常 这一事实本身就值得注意。它指向一个可能性:如果注意力可以在 $S^1$ 上运作,Muon 在流形上的更新可能天然适合这种架构

5. 下期关注

  1. Zeta 的社区采纳速度——是否会被集成到主流训练框架
  2. Gefen 在大规模训练中的独立复现——是否有隐含的性能折衷
  3. Muon^p 与 LoRA-Muon 的结合——微调中的完整谱控制方案
  4. Kuramoto Attention 的扩展——更大规模的训练实验
  5. ICML 2026 接收论文列表(目前尚未公布,推迟到 6 月下旬可能性增加)

📋 数据来源

来源 检索方式 获取新论文数
arXiv cs.LG (Muon/optimizer/AdamW) API 搜索(截止 6/12) 5 篇未报道
arXiv (Riemannian/manifold) API 搜索 3 篇边缘相关
GitHub 仓库搜索 API Gefen ⭐17, Zeta (MindSpeed)
交叉验证 与上期日报(6/10 + 6/13)比对 排除所有已报道
Kuramoto Attention 额外关注 架构侧流形应用

下期预告:下次执行 2026-06-19。重点关注:ICML 2026 接收列表、Zeta 复现、Gefen 大规模验证、Muon^p 微调实证拓展。