大模型优化器&流形优化日报 — 2026年5月4日

大模型优化器&流形优化日报 — 2026年5月4日

大模型优化器 & 流形优化日报

日期:2026-05-04 | 覆盖区间:2026-04-29 ~ 2026-05-04
上期报告2026-04-28 日报

⚠️ 注:本期覆盖区间恰逢五一假期,arXiv 最后一波提交日为 4 月 30 日,5 月 1-4 日无新论文入库。本期整体内容量偏少,另附一期重要补遗。


📌 本期重点(最值得关注)

1. 🔥 补遗:Newton-Muon 优化器——Muon 的牛顿法变体

  • 论文The Newton-Muon Optimizer (arXiv:2604.01472, Apr 1)
  • 作者:Zhehang Du, Weijie Su(宾夕法尼亚大学沃顿商学院)
  • 关键贡献
    • 首次为 Muon 优化器的设计原理(矩阵梯度正交化)提供了替代模型解释:将损失近似为权重矩阵扰动的二次函数,仅用三个矩阵(梯度 G、输出空间曲率 H、输入空间曲率 K)构建
    • 从该替代模型推导出一种Newton-Muon 优化器,继承了牛顿法的二阶收敛优势
    • 通过 Newton-Schulz 迭代近似矩阵平方根逆,实现高效的正则化二阶更新
    • 在小规模实验中验证了优于原始 Muon 和 AdamW 的性能
  • 重要性:这是 Muon 家族首个引入显式二阶几何信息(曲率)的变体,填补了 Muon 理论基础的空白。此前日报报道了 Muon²(4/11)、Mousse(3/10)、Mano(1/30),但 Newton-Muon 是此前遗漏的重要成员。
  • ⚠️ 注:发表于 4 月 1 日,但前两期日报未覆盖,特此补录。

2. 黎曼优化新突破:非光滑流形上的 proximal bundle 方法

  • 论文Nonsmooth Riemannian optimization with inexact manifold primitives via bundle methods (arXiv:2604.27078, Apr 29)
  • 作者:Mateo Díaz, Benjamin Grimmer, Ian McPherson(约翰·霍普金斯大学)
  • 关键贡献
    • 针对 Hadamard 流形(全局测地凸问题的自然黎曼设定),现有理论要求精确的指数映射和平行传输,而实际软件包依赖近似实现
    • 引入 proximal bundle 方法用于非光滑测地凸优化,首次提供非渐近收敛速率
    • 允许使用不精确的流形原语(retraction 和 vector transport),弥合了理论与实践的差距
  • 重要性:此前日报报道了 Non-Lipschitz 黎曼优化的复杂度结果(4/20),本文是流形优化理论实用化的又一里程碑。

📊 大模型优化器

新论文

论文 日期 要点
Newton-Muon arXiv:2604.01472 Apr 1 🔄 Muon + 牛顿法二阶曲率信息,替代模型揭示 Muon 设计原理
ZipCCL arXiv:2604.27844 Apr 30 🆕 分布式 LLM 训练通信压缩:利用梯度/参数的近高斯分布特性,无损压缩通信 collective 数据
FADE: Adaptive Weight Decay arXiv:2604.27063 Apr 29 🆕 自适应权重衰减:参数级动态遗忘率,替代固定标量 weight decay。Jürgen Schmidhuber 参与
Cost-Aware Learning arXiv:2604.28020 Apr 30 🆕 有限和目标中不同样本有不同采样成本,提出 Cost-Aware SGD,应用于 LLM 的 RL 训练

趋势观察

  1. Muon 家族持续扩容:Newton-Muon 的发现将 Muon 变体从 3 个(Muon²/Mousse/Mano)扩展至 4 个。Muon 的理论基础正从”经验驱动”向”理论-经验双轮驱动”转变。

  2. 分布式训练效率成焦点:ZipCCL 将目光投向优化器之外的训练系统瓶颈——通信。结合此前报道的 Canzona 分布式优化框架,LLM 训练的”计算-通信-优化器”全栈优化趋势明确。

  3. 权重衰减的精细化:FADE 论文挑战了 AdamW 中固定权重衰减系数的做法,提出参数级自适应衰减。这有可能影响下一代优化器的默认配置。

  4. 本期新增论文偏少:受五一假期影响,4 月 30 日后 arXiv 无新入库。预计下一期(5 月 7 日)内容将大幅回暖。


🔄 流形优化

新论文

论文 日期 要点
Nonsmooth Riemannian Optimization with Inexact Primitives arXiv:2604.27078 Apr 29 🆕 Hadamard 流形上的 proximal bundle 方法,首次支持不精确流形原语,给出非渐近收敛速率
Zeroth-Order Methods for Riemannian Optimization arXiv:2604.26913 Apr 29 🆕 推广瑞利商的零阶优化到黎曼设定,连接零阶方法到黎曼一/二阶优化

趋势观察

  1. 流形优化从”纯数学”走向”实用计算”:2604.27078 明确针对软件实现的现实——几乎所有流形优化软件包都用近似 retraction 替代精确指数映射,但理论长期缺位。该论文补上了这块拼图。

  2. 与深度学习的交集仍以理论铺路为主:本期流形优化论文集中于 math.OC,尚未出现直接应用于 LLM 训练的工作(如流形约束优化器、黎曼 Adam 等)。这个交叉方向仍需等待。

  3. 零阶/无梯度方法向黎曼设定延伸(2604.26913):在无法获取梯度或 Hessian 的场景,零阶方法在黎曼流形上的推广有潜在应用价值(如黑盒优化、超参数搜索)。

参见此前日报中与深度学习更紧密结合的流形工作:2026-04-28 日报(FedSPDnet、GeoEdit 等)


💡 讨论/观点

社区动态

  • 本期社区讨论偏冷:五一假期期间 HN、Reddit r/ML、中文技术社区均未发现大模型优化器相关的重要新讨论。Reddit 和 HN API 返回空或 400 错误(可能受爬虫限制影响)。

值得关注的趋势信号

  1. Newton-Muon 会否引发 Muon vs Newton-Muon 的基准竞赛? 该论文目前仅在小规模实验中验证,社区是否会跟进大规模对比测试(如 1B+ 参数级别)是下一个看点。

  2. Cost-Aware Learning 的实用前景:在 LLM 的 RLHF/GRPO 训练中,不同 prompt 的采样和推理成本差异显著。Cost-Aware SGD 将成本纳入优化目标,可能影响 RL 训练的效率。

  3. ZipCCL 与优化器的协同:通信压缩 + 优化器(如低精度优化器、通信稀疏化)的联合设计可能成为下一个系统-算法交叉的研究热点。


📋 下期预告

下一期计划于 2026-05-07 运行。届时 arXiv 将恢复每日入库(5 月 5 日起),预计将有大量新论文出现。重点关注: - Newton-Muon 是否会有后续讨论或大规模实验 - 五一假期积压的论文集中发布 - 流形优化与深度学习结合的新工作(期待突破)


*报告生成时间:2026-05-04 08:00 CST 下次运行:2026-05-07 08:00 CST*