大模型优化器&流形优化日报 — 2026年5月4日
大模型优化器&流形优化日报 — 2026年5月4日
大模型优化器 & 流形优化日报
日期:2026-05-04 | 覆盖区间:2026-04-29 ~ 2026-05-04
上期报告:2026-04-28 日报
⚠️ 注:本期覆盖区间恰逢五一假期,arXiv 最后一波提交日为 4 月 30 日,5 月 1-4 日无新论文入库。本期整体内容量偏少,另附一期重要补遗。
📌 本期重点(最值得关注)
1. 🔥 补遗:Newton-Muon 优化器——Muon 的牛顿法变体
- 论文:The Newton-Muon Optimizer (arXiv:2604.01472, Apr 1)
- 作者:Zhehang Du, Weijie Su(宾夕法尼亚大学沃顿商学院)
- 关键贡献:
- 首次为 Muon 优化器的设计原理(矩阵梯度正交化)提供了替代模型解释:将损失近似为权重矩阵扰动的二次函数,仅用三个矩阵(梯度 G、输出空间曲率 H、输入空间曲率 K)构建
- 从该替代模型推导出一种Newton-Muon 优化器,继承了牛顿法的二阶收敛优势
- 通过 Newton-Schulz 迭代近似矩阵平方根逆,实现高效的正则化二阶更新
- 在小规模实验中验证了优于原始 Muon 和 AdamW 的性能
- 重要性:这是 Muon 家族首个引入显式二阶几何信息(曲率)的变体,填补了 Muon 理论基础的空白。此前日报报道了 Muon²(4/11)、Mousse(3/10)、Mano(1/30),但 Newton-Muon 是此前遗漏的重要成员。
- ⚠️ 注:发表于 4 月 1 日,但前两期日报未覆盖,特此补录。
2. 黎曼优化新突破:非光滑流形上的 proximal bundle 方法
- 论文:Nonsmooth Riemannian optimization with inexact manifold primitives via bundle methods (arXiv:2604.27078, Apr 29)
- 作者:Mateo Díaz, Benjamin Grimmer, Ian McPherson(约翰·霍普金斯大学)
- 关键贡献:
- 针对 Hadamard 流形(全局测地凸问题的自然黎曼设定),现有理论要求精确的指数映射和平行传输,而实际软件包依赖近似实现
- 引入 proximal bundle 方法用于非光滑测地凸优化,首次提供非渐近收敛速率
- 允许使用不精确的流形原语(retraction 和 vector transport),弥合了理论与实践的差距
- 重要性:此前日报报道了 Non-Lipschitz 黎曼优化的复杂度结果(4/20),本文是流形优化理论实用化的又一里程碑。
📊 大模型优化器
新论文
| 论文 | 日期 | 要点 |
|---|---|---|
| Newton-Muon arXiv:2604.01472 | Apr 1 🔄 | Muon + 牛顿法二阶曲率信息,替代模型揭示 Muon 设计原理 |
| ZipCCL arXiv:2604.27844 | Apr 30 🆕 | 分布式 LLM 训练通信压缩:利用梯度/参数的近高斯分布特性,无损压缩通信 collective 数据 |
| FADE: Adaptive Weight Decay arXiv:2604.27063 | Apr 29 🆕 | 自适应权重衰减:参数级动态遗忘率,替代固定标量 weight decay。Jürgen Schmidhuber 参与 |
| Cost-Aware Learning arXiv:2604.28020 | Apr 30 🆕 | 有限和目标中不同样本有不同采样成本,提出 Cost-Aware SGD,应用于 LLM 的 RL 训练 |
趋势观察
-
Muon 家族持续扩容:Newton-Muon 的发现将 Muon 变体从 3 个(Muon²/Mousse/Mano)扩展至 4 个。Muon 的理论基础正从”经验驱动”向”理论-经验双轮驱动”转变。
-
分布式训练效率成焦点:ZipCCL 将目光投向优化器之外的训练系统瓶颈——通信。结合此前报道的 Canzona 分布式优化框架,LLM 训练的”计算-通信-优化器”全栈优化趋势明确。
-
权重衰减的精细化:FADE 论文挑战了 AdamW 中固定权重衰减系数的做法,提出参数级自适应衰减。这有可能影响下一代优化器的默认配置。
-
本期新增论文偏少:受五一假期影响,4 月 30 日后 arXiv 无新入库。预计下一期(5 月 7 日)内容将大幅回暖。
🔄 流形优化
新论文
| 论文 | 日期 | 要点 |
|---|---|---|
| Nonsmooth Riemannian Optimization with Inexact Primitives arXiv:2604.27078 | Apr 29 🆕 | Hadamard 流形上的 proximal bundle 方法,首次支持不精确流形原语,给出非渐近收敛速率 |
| Zeroth-Order Methods for Riemannian Optimization arXiv:2604.26913 | Apr 29 🆕 | 推广瑞利商的零阶优化到黎曼设定,连接零阶方法到黎曼一/二阶优化 |
趋势观察
-
流形优化从”纯数学”走向”实用计算”:2604.27078 明确针对软件实现的现实——几乎所有流形优化软件包都用近似 retraction 替代精确指数映射,但理论长期缺位。该论文补上了这块拼图。
-
与深度学习的交集仍以理论铺路为主:本期流形优化论文集中于 math.OC,尚未出现直接应用于 LLM 训练的工作(如流形约束优化器、黎曼 Adam 等)。这个交叉方向仍需等待。
-
零阶/无梯度方法向黎曼设定延伸(2604.26913):在无法获取梯度或 Hessian 的场景,零阶方法在黎曼流形上的推广有潜在应用价值(如黑盒优化、超参数搜索)。
参见此前日报中与深度学习更紧密结合的流形工作:2026-04-28 日报(FedSPDnet、GeoEdit 等)
💡 讨论/观点
社区动态
- 本期社区讨论偏冷:五一假期期间 HN、Reddit r/ML、中文技术社区均未发现大模型优化器相关的重要新讨论。Reddit 和 HN API 返回空或 400 错误(可能受爬虫限制影响)。
值得关注的趋势信号
-
Newton-Muon 会否引发 Muon vs Newton-Muon 的基准竞赛? 该论文目前仅在小规模实验中验证,社区是否会跟进大规模对比测试(如 1B+ 参数级别)是下一个看点。
-
Cost-Aware Learning 的实用前景:在 LLM 的 RLHF/GRPO 训练中,不同 prompt 的采样和推理成本差异显著。Cost-Aware SGD 将成本纳入优化目标,可能影响 RL 训练的效率。
-
ZipCCL 与优化器的协同:通信压缩 + 优化器(如低精度优化器、通信稀疏化)的联合设计可能成为下一个系统-算法交叉的研究热点。
📋 下期预告
下一期计划于 2026-05-07 运行。届时 arXiv 将恢复每日入库(5 月 5 日起),预计将有大量新论文出现。重点关注: - Newton-Muon 是否会有后续讨论或大规模实验 - 五一假期积压的论文集中发布 - 流形优化与深度学习结合的新工作(期待突破)
| *报告生成时间:2026-05-04 08:00 CST | 下次运行:2026-05-07 08:00 CST* |