🔬 大模型优化器 & 流形优化日报
覆盖日期:2026年6月13日 – 6月16日
上期成功报告:2026年6月13日
本期执行:2026年6月16日 08:00
📌 本期重点
🔥 1. Zeta:双白化矩阵优化——修复 Muon 的 NS 迭代脆弱性(2606.14187)
| 维度 |
详情 |
| 论文 |
2606.14187 — Kaiwen Chen, Shuhai Zhang, Mingkui Tan 等(华南理工) |
| 提交 |
2026年6月12日 |
| 核心洞察 |
Muon 的 Newton-Schulz 迭代有一个被忽视的弱点:严重依赖输入条件数,而原始动量矩阵在各个坐标维度上存在严重的尺度异质性 |
| 验证 |
通过卡方均匀性检验证明:Transformer 各层普遍存在矩阵内部尺度不均衡,坐标白化可以有效校正 |
| 方法 |
Zeta 提出有序双白化流水线:坐标白化(Coordinate Whitening)→ 谱白化(Spectral Whitening),先建立统计各向同性→再可靠执行正交化 |
| 理论 |
严格证明双流水线通过改善输入条件数,显著降低正交化误差 |
| 实证 |
0.6B–8B 参数语言建模、MoE 架构、视觉任务——匹配或超越 Muon 基线,收敛更快、泛化更好 |
| 代码 |
https://gitcode.com/kevin259/MindSpeed |
意义:直接回答了上期 Muon^p 和过去 Spectral Scaling Laws 共同发现的问题——Muon 的 NS 迭代在大规模下表现不稳定。Zeta 从输入条件数入手,用坐标白化+谱白化的有序组合系统性解决了这个工程瓶颈,是 Muon 工程化的重要进步。
🔥 2. Free Heavy-Tailed Lunch for Muon——Suvrit Sra 团队理论证明 Muon 最优(2606.14560)
| 维度 |
详情 |
| 论文 |
2606.14560 — Florian Hübler, Thomas Pethick, Suvrit Sra(MIT/TU Munich) |
| 提交 |
2026年6月12日 |
| 核心 |
在重尾非凸随机优化框架下,首个严格证明 Muon 在核范数平稳度量下达到最优样本复杂度 |
| 关键定理 |
对 $m\times n$ 矩阵,Muon 在核范数中找 $\varepsilon$-稳定点只需 $\mathcal{O}\left(\min{m,n} \frac{\Delta_1 L}{\varepsilon^2} \left(\frac{\sigma}{\varepsilon}\right)^{\frac{p}{p-1}}\right)$ 个样本,吸收重尾噪声而无额外维度依赖 |
| 对比 |
欧几里得方法在相同平稳度量下需要额外维度依赖的成本 |
| 惊喜发现 |
结论暗示其他 Schatten 几何(而不只是 Muon 的谱几何)在某些设置下也能取得有竞争力性能 |
| 实证 |
在 LLM 上验证了理论预期 |
意义:Suvrit Sra(MIT 优化理论大牛)的团队为 Muon 的卓越实证表现提供了最严格的样本复杂度理论证明——此前所有理论工作(NDS 曲率、谱动力学、熵最大化)都是从「为什么好」角度分析,而该工作从「最优性」角度证明了 Muon 在重尾噪声场景下理论上不可超越。
📊 大模型优化器(仅限新内容)
🟢 Gefen:~8x 内存压缩的 AdamW 替代品(2606.13894,6月11日)
| 维度 |
详情 |
| 作者 |
Nadav Benedek, Tomer Koren, Ohad Fried(Tel Aviv University) |
| 核心 |
AdamW 的一阶/二阶矩占用约 2× 参数量内存 → Gefen 通过 自动块级共享二矩 + 学习码本量化一矩 将内存压缩 ~8x |
| 节省 |
6.5 GiB / billion parameters,在 FSDP/DDP 下可直接换大 batch |
| 理论动机 |
大混合 Hessian 项会将参数约束到相似的梯度平方比 → Hessian 对齐的参数自然适合共享二矩统计量 |
| 实践 |
从初始梯度平方推断块结构,无需架构元数据——真正的即插即用 |
| 代码 |
github.com/ndvbd/Gefen ⭐17,含 fused CUDA JIT 核 |
意义:如果 Gefen 能在广泛实验中被验证,它将直接解决大模型训练中 AdamW 内存开销的第一性瓶颈。与 Muon 系列正交——可以叠加使用。
🟢 Muon^p:分数谱幂——何时应保留而非抹平奇异值?(2606.13867,6月11日)
| 维度 |
详情 |
| 作者 |
Yihe Dong, Will Sawin |
| 核心 |
Muon 用 $UV^\top$ 完全抹平奇异值谱 → 但有时保留谱信息更重要 → 提出 $US^pV^\top$($p\in(0,1)$ 有理数),在 Muon 和 GD 之间插值 |
| 理论障碍 |
证明分数谱幂不能通过任何固定单变量多项式迭代计算 → 推导低次奇双变量递归逼近,保持 Muon 的矩阵乘法结构 |
| 最优性 |
在 Schatten $q$-范数下($q=1+1/p$)最大化损失线性改善 |
| 实证 |
微调场景特别有效(亿级模型上验证困惑度和下游任务改善) |
| 局限性 |
分析了何时不适合保留谱(通过谱几何) |
意义:Muon^p 与上期 LoRA-Muon 在「如何在不同场景下处理谱」上有互补性——LoRA-Muon 回答了低秩流形上的谱处理,Muon^p 回答了全秩时的部分谱保留。两者共同指向一个结论:一刀切的完全谱抹平并非最优策略。
🟢 Beyond a Single Explanation of the Adam–SGD Gap(2606.14259,6月12日)
| 维度 |
详情 |
| 作者 |
Chenxiang Zhang, Rustem Islamov 等(多机构) |
| 范围 |
跨视觉、语言、基因组学、图任务,覆盖现代和经典架构,受控实证研究 |
| 核心发现 |
没有单一因素能一致解释 Adam–SGD 差距:(1) 均匀词汇分布下差距持续,重尾分布下消失;(2) softmax-attention 模型中 SGD 反超 Adam;(3) ReLU → GeLU 等软修改放大差距 |
| 关键模式 |
发现一个 「交叉批大小」(crossover batch size)——随批大小扩大,优势从 SGD 转向 Adam |
| 理论模型 |
捕获了这一批大小依赖的交叉现象,调和多个现有假说 |
意义:在 Muon 席卷一切的今天,这篇论文提醒我们 Adam vs. SGD 的最基本问题至今没有统一答案——更不用说 Adam vs. Muon 了。batch-size 交叉现象可能为理解 Muon 的批大小依赖提供线索。
🟢 Denoise First, Orthogonalize Later(2606.03899,6月2日)——补报
| 维度 |
详情 |
| 作者 |
Xianliang Li, Zihan Zhang, Weiyang Liu, Han Bao |
| 核心 |
首次系统证明 Muon 中的动量扮演谱滤波器角色:在结构化信号+扰动梯度模型下,动量压制扰动、保留主导信号、扩大谱间隙 |
| 关键结论 |
先做动量再做正交化,比反向顺序或去掉动量,对信号对齐有可证明更强的效果 |
| 实验 |
在 LLM 预训练等任务上验证了理论 |
| 为何补报 |
该文为理解『为何 Muon 中的 momentum 有效』提供了最干净的解释,但与上期报告中已涵盖的 Poggio 谱动力学不冲突——前者从熵角度,这里从谱滤波角度 |
📊 新论文一览
| 论文 |
ID |
日期 |
方向 |
核心贡献 |
| Zeta ★ |
2606.14187 |
6/12 |
Muon 工程修复 |
双白化解决 NS 条件数依赖,0.6B-8B 验证 |
| Free Heavy-Tailed Lunch ★ |
2606.14560 |
6/12 |
Muon 理论最优性 |
核范数平稳下样本复杂度最优,无法被超越 |
| Gefen |
2606.13894 |
6/11 |
内存优化 |
AdamW 8x 内存压缩,CUDA 实现已开源 |
| Muon^p |
2606.13867 |
6/11 |
谱插值优化 |
分数谱幂保留奇异值信息,微调特别有效 |
| Adam-SGD Gap |
2606.14259 |
6/12 |
基础理解 |
无单因素解释差距,发现交叉批大小 |
| Denoise First(补报) |
2606.03899 |
6/2 |
Muon 动量理论 |
动量=谱滤波器,先滤波后正交化更强 |
🔄 流形优化(仅限前几期未覆盖的新内容)
🟢 Kuramoto Attention:在圆环面上的自注意力同步(2606.11585,6月10日)
| 维度 |
详情 |
| 作者 |
Joshua Nunley(独立作者) |
| 核心 |
将自注意力的每个隐藏坐标定义为角度(属于圆环面 $S^1$),注意力加权圆环面均值更新正好等于 Kuramoto 耦合项 $\sum_u A_{t,u}\sin(\theta_u-\theta_t)$ |
| 数学优雅性 |
紧致群上只需两个要素:不变相似度得分 + 流形上均值运算 → 环面是阿贝尔群情况,两者都有闭式解 |
| RoPE 连接 |
旋转位置编码自然成为得分中的位置相关相位漂移 |
| 实证 |
enwiki8 字符级 LM:1M 参数量下 BPC $1.637\pm0.010$,匹配 SwiGLU 基线的 $1.616\pm0.004$;5M 参数中位数持平 |
| 结论 |
流形约束几何结构在~百万参数量级上可作为功能正常的语言模型 |
意义:这不是一篇优化器论文,而是一篇将注意力机制重新理解为流形上同步过程的架构工作。从优化器视角看:如果在 Kuramoto attention 上训练,反向传播通过 sin/cos 的梯度计算与标准注意力截然不同——这可能自然契合 Muon 的谱更新风格(因为参数在圆环面上自然有界)。
🟢 PermDoRA——参数空间几何无法解释 LoRA 干扰(2606.11262,6月9日)
| 维度 |
详情 |
| 作者 |
Gowtham Sivaramakrishnan 等 |
| 核心 |
在 LLaMA-3.1-8B / Mistral-7B 上用 DoRA-RBAC 框架测试:黎曼启发式合并(Frêchet 均值平均化)不优于标准平均 |
| 诊断 |
适配器更新的角度对齐和正交性与合并性能弱相关 |
| 结论 |
适配器干扰不由参数空间几何主导——而是共享非线性表示的交互 |
意义:对上期模块感知流形分配(Attention=Stiefel + MLP=DGram)形成对照——该文表明参数空间的几何约束不是万能的,干扰主要发生在表示空间而非权重空间。
🟢 Riemannian Metric Matching(2606.14334,6月12日)
| 维度 |
详情 |
| 作者 |
Jacob Bamberger, Adam Gosztolai, Pierre Vandergheynst, Michael Bronstein 等 |
| 核心 |
用黎曼度量匹配从高维数据样本中可扩展地估计内在几何 |
| 方法 |
避免传统图/核方法的 $\mathcal{O}(N^2)$ 扩展瓶颈 |
| 适用 |
高维数据集的几何建模(与优化器不直接相关,属于流形学习工具) |
其他方向
| 方向 |
状态 |
| 几何深度学习 |
Kuramoto Attention(上)为架构层级的流形应用 |
| 流形×LLM 交叉 |
本期无新增直接交叉论文。PermDoRA 从反面给出经验约束——参数空间几何不主导干扰 |
| Riemannian 优化理论 |
Riemannian Metric Matching 是流形学习工具,非优化器理论 |
| iMuon(2605.09238) |
无社区复现更新 |
💡 讨论与趋势
1. Muon 研究的「工程化转向」
| 阶段 |
时间 |
特征 |
代表 |
| 🧪 变体爆发 |
5月 |
各种 Muon 变体满天飞 |
Pion, MONA, NuMuon, SPECTRA |
| 📐 理论深化 |
5月底-6月初 |
解释「为什么好」 |
NDS 曲率, Poggio 熵, 谱缩放律 |
| 🔧 工程化修复 |
本期 |
修复已知问题→让 Muon 在大规模下可靠 |
Zeta(修复 NS 条件数), Denoise First(理解动量) |
Zeta 的出现在标志性意义上非常重要:Muon 社区正在从「发明新变体」转向「修复工程缺陷」。Zeta 直接定位了 NS 迭代在大规模下的脆弱性并给出了系统解。
2. 「保留谱」思潮兴起——Muon^p 与 LoRA-Muon 的互补信号
| 工作 |
做什么 |
应用场景 |
| Muon(原始) |
完全抹平谱 → $UV^\top$ |
预训练 |
| Muon^p(本期) |
部分保留谱 → $US^pV^\top$, $p\in(0,1)$ |
微调 |
| LoRA-Muon(上期) |
低秩流形上谱最陡下降 |
LoRA 微调 |
三者形成一条完整谱线:预训练要抹平→微调要部分保留→LoRA 要低秩谱最陡下降。这是一个值得关注的模式。
3. 内存优化器进入「即插即用」阶段
Gefen(已开源 PyPI + fused CUDA)直接将 AdamW 内存压至 1/8,且声称与 AdamW 性能持平。与之前在 5 月份报道的 PowerStep、GaLore 等内存优化方法相比,Gefen 的可部署性明显更高。
4. Kuramoto Attention:Attention 的「流形几何化」信号
虽然只是一篇独立作者的探索性工作,但 1M 参数语言模型在流形约束下功能正常 这一事实本身就值得注意。它指向一个可能性:如果注意力可以在 $S^1$ 上运作,Muon 在流形上的更新可能天然适合这种架构。
5. 下期关注
- Zeta 的社区采纳速度——是否会被集成到主流训练框架
- Gefen 在大规模训练中的独立复现——是否有隐含的性能折衷
- Muon^p 与 LoRA-Muon 的结合——微调中的完整谱控制方案
- Kuramoto Attention 的扩展——更大规模的训练实验
- ICML 2026 接收论文列表(目前尚未公布,推迟到 6 月下旬可能性增加)
📋 数据来源
| 来源 |
检索方式 |
获取新论文数 |
| arXiv cs.LG (Muon/optimizer/AdamW) |
API 搜索(截止 6/12) |
5 篇未报道 |
| arXiv (Riemannian/manifold) |
API 搜索 |
3 篇边缘相关 |
| GitHub 仓库搜索 |
API |
Gefen ⭐17, Zeta (MindSpeed) |
| 交叉验证 |
与上期日报(6/10 + 6/13)比对 |
排除所有已报道 |
| Kuramoto Attention |
额外关注 |
架构侧流形应用 |
下期预告:下次执行 2026-06-19。重点关注:ICML 2026 接收列表、Zeta 复现、Gefen 大规模验证、Muon^p 微调实证拓展。