大模型优化器 & 流形优化日报 — 2026年7月19日

大模型优化器 & 流形优化日报 — 2026年7月19日

🔬 大模型优化器 & 流形优化日报

覆盖日期:2026年7月16日 – 7月19日 上期成功报告:2026年7月16日 本期执行:2026年7月19日


📌 本期重点

🔥 1. Muse:Muon 优化器的表示几何——超越归一化动量(2607.14536)

维度 详情
论文 2607.14536
提交 2026年7月16日
作者 Da Chang, Qiankun Shi, Lvgang Zhang, Di He, Yaoshuai Ma, Ganzhao Yuan, Yongxiang Liu
核心发现 Muon 类优化器的更新不仅取决于动量矩阵的极分解,还取决于参数块在正交化前的表示形状。将参数张量重塑为「原生矩形」「最近正方形」「瘦高形」「平铺形」等不同表示,会诱导出不同的极陡下降几何,其中较短的矩阵维度决定了支持的奇异通道数、pullback 缩放和随机非凸收敛界中的常数
方法 提出 Muse 系列,在相同动量规则和 Newton-Schulz 后端下统一考察多种 Frobenius 等距表示
实验 LLaMA2-130M 和 LLaMA2-600M 预训练实验表明:平衡的非原生表示可与原生表示性能持平,但缩短较短的维度会削弱缩放律和奇异通道支持,行为逐渐退化为归一化动量
意义 首次系统研究 Muon 的参数表示几何——回答了 Muon 社区一个重要问题:「为什么实践中常把矩阵补齐为正方形?」本文给出了理论解释:表示形状决定了 Muon 的几何性质和收敛保证

🔥 2. ELO:高效长视野学习——学习优化器首次系统击败 AdamW(2607.06772)

维度 详情
论文 2607.06772
提交 2026年7月15日(v4 更新)
作者 Xiaolong Huang, Benjamin Thérien, James Harrison, Eugene Belilovsky
核心 学习优化器(Learned Optimizer)的元训练存在两个问题:(1) 短展开训练浪费大量计算;(2) 在未见过的长展开任务上泛化差。ELO 两项创新:(1) 将浪费的元训练计算重新分配到长失败场景;(2) 解耦渐进专家监督,提供稳定的元学习信号
效果 GPT-2 124M/350M(FineWeb)和 ViT-B/16、ResNet-50(ImageNet-1K)上,ELO-Celo2 一致超越精心调参的 AdamW,并可与 Muon 竞争。整个元训练仅需 <7 H100 GPU-hours
意义 ⭐ 学习优化器领域的重要里程碑——首次在多种架构和规模上系统性证明学习优化器可以可靠地击败手工设计的 AdamW

📊 大模型优化器(仅限新内容)

🟢 Reassessing Muon:Muon 在矩阵分解上的审慎评估(2607.13246)

维度 详情
论文 2607.13246
提交 7月14日(上期遗漏,首次覆盖)
作者 Ali Parviz, Gal Mishne, Alex Cloninger
核心 将 Muon 从 LLM 训练的 confound 中隔离,放到低秩矩阵分解这个简单且谱结构清晰的经典问题上测试。在严格控制的条件下与精心调参的自适应基线对比,发现:Muon 在此类问题上并不一致优于 AdamW,多个此前报告的增益对超参数选择敏感
意义 与 Muse 形成镜像——Muse 深入理解 Muon 何时为何有效,而 Reassessing Muon 提醒我们它的优势不是普适的。当前 Muon 类研究应加入「受控问题的平行测试」

🟢 RK-Adam 的诚实评估:自适应 Runge-Kutta 步长买得到训练 Loss 但买不到泛化(2607.14516)

维度 详情
论文 2607.14516
提交 7月16日
作者 Akhilesh Gogikar(单人)
核心 在严格计算量匹配协议下(RK-Adam 每步 3-4 个梯度 vs Adam 的 1 个),RK-Adam 在训练 Loss 上输给普通 Adam。诊断发现其「自适应性是幻觉」:归一化误差远低于容差、步长从第一步就卡在增长上限(98-100% 步长均如此)。修复后反向结果:训练 Loss 比 Adam 低 ~40×,但增益对初始步长敏感且不转化为测试精度。梯度平均是真正的隐式正则化器,但 RMSprop 和 NAdam 以 1/3 的代价匹配或超越它
意义 对「优化器即 ODE 离散化」研究路线的重要负面实证——高阶 Runge-Kutta 积分在深度学习中不提供 Adam 无法获得的实用优势

🟢 Interleaved Noise Injection:交错噪声注入提升干净/损坏/OOD 性能(2607.14466)

维度 详情
论文 2607.14466
提交 7月16日
作者 Matt L. Wiemann, Peter Melchior, Andrew K. Saydjari
核心 噪声注入通常使用单调衰减调度。本文发现交错(on-off-on-off…)调度远比单调衰减有效。理论分析:脉冲噪声 ≈ Jacobian 正则化,高斯噪声 ≈ 曲率惩罚。交错混合干净/噪声数据阶段使优化器能逃离局部最小值而不遗忘干净特征。引入梯度范数稳定化技术,切换数据时缩放噪声更新
效果 CIFAR-100-C、ImageNet-C、ImageNet-R 上 ResNet 和 ViT 架构均有显著提升。与现有增强方法可叠加使用。本质上零开销
意义 简洁实用的训练技巧——不修改优化器架构,仅改动噪声调度,可与任何优化器配合

🟢 方向汇总

方向 状态
Muon 表示几何 Muse 首次系统建立 Muon 的参数表示几何理论;Reassessing Muon 在受控问题上的审慎评估形成对照
Muon/SOAP 家族综述 本期两篇论文从正反两面加深了对 Muon 的理解
学习优化器 ELO 实现学习优化器首次系统性击败 AdamW 的里程碑
高阶优化器(RK-Adam) 负面结果:Runge-Kutta 积分不提供实用优势
训练技巧 交错噪声注入——零成本性能提升
AdamW 改进 本期无新增

本期趋势:Muon 研究从「发明新变体」进入「深入理解其几何机理」阶段。Muse 和 Reassessing Muon 两篇工作同步出现,一正一反对 Muon 的本质做出了重要澄清。


🔄 流形优化(仅限新内容)

本期无新增内容

2026年7月16日 – 7月19日期间,arXiv 上未出现新的流形优化相关论文。上期(7月16日)已覆盖的 RIPO、Cobras、Stiefel Newton 加速、Affine-Invariant 预条件等工作仍是该领域最新的进展。

请关注下期窗口,尤其是: - RIPO 和 Cobras 的社区回应和后续工作 - Zavier Li 的几何优化系列下一部(Affine-Invariant Preconditioning 之后)


💡 讨论与趋势

1. 「Muon 理解」进入新阶段

本期最重要的趋势是:Muon 的研究从「巧妙的工程启发式」向「形式化的几何理论」迈进:

工作 贡献类型 关键洞察
Muse (2607.14536) ✅ 正面理论 参数表示形状 = 优化器几何;较短的维度决定奇异通道支持
Reassessing Muon (2607.13246) ⚠️ 审慎评估 在控制问题上 Muon 并不一致优于 AdamW
综合 二者互补 Muse 解释「为什么按特定方式使用 Muon」,Reassessing Muon 提醒「不要假设 Muon 在所有问题上都优于 AdamW」

建议下一期关注这两篇工作是否引发社区讨论或实验验证。

2. ELO:学习优化器终于「学会了」

ELO 的元训练仅需 <7 H100-hours 就能产出在 GPT-2 124M/350M 和 ViT-B/16 上一致击败 AdamW 的优化器。这是学习优化器(Learned Optimizer)领域的一个重要里程碑。如果 ELO 的方法能扩展到更大规模(如 7B+ 模型),它可能改变「优化器设计」的游戏规则——从手工设计转变为元学习生成。

3. RK-Adam 的诚实评估树立方法论标杆

Gogikar 的论文不仅是「RK-Adam 不 work」的负面结果,更是在方法论上做出了重要贡献:(1) 严格的计算匹配协议;(2) 详尽的消融诊断(”illlusory adaptivity”);(3) 诚实报道负面结果。在优化器论文普遍只报正面结果的环境中,这种严谨值得推广。

4. 流形优化方向暂时平静

本期流形优化无新增论文。但上次(7月16日)RIPO 和 Cobras 两篇「流形 × LLM」交叉工作的出现,可能意味着该领域正在酝酿更大的突破。建议下期特别关注 RIPO 的 GitHub 仓库是否有更新或社区讨论。

5. 下期关注

  1. Muse 是否会开源及在更大规模(7B+)上的验证
  2. ELO 的学习优化器是否能扩展到 1B+ 参数
  3. RIPOCobras 的社区后续跟进
  4. Reassessing Muon 的结论是否会在 Muon 社区引发讨论
  5. 7月19-22日 arXiv 新提交窗口(周一/周二是密集窗口)

📦 存档信息

  • 文件名:2026-07-19-llm-optimizer-manifold-daily.md
  • 关联上期:2026-07-16-llm-optimizer-manifold-daily.md