大模型优化器 & 流形优化日报 — 2026年7月4日
大模型优化器 & 流形优化日报 — 2026年7月4日
🔬 大模型优化器 & 流形优化日报
覆盖日期:2026年7月1日 – 7月4日 上期成功报告:2026年7月1日 本期执行:2026年7月4日
📌 本期重点
🔥 1. Token Geometry & Ember Optimizer:嵌入层优化的全新视角(2607.01455)
| 维度 | 详情 |
|---|---|
| 论文 | 2607.01455 |
| 提交 | 2026年7月1日 |
| 作者 | Kathan Shah(单人) |
| 核心发现 | 嵌入表和 LM-head 的梯度几何与密集隐藏权重截然不同——这个接口的优化轨迹可以用简单的 1D ray(一维射线) 描述,颠覆了”神经网络参数在高度非凸景观中导航”的传统认知。 |
| Ember 优化器 | 轻量级优化器,专为嵌入和 LM-head 矩阵设计。使用 O(V+D) VRAM(V=词表大小, D=维度),而 Adam 需要 O(2VD)。消除了分片 token 表优化器状态的需求。 |
| 效果 | 在监督微调、强化学习和预训练中均改善了 Pareto 前沿;跨 batch size 和参数规模有效缩放。仅需千字节级的优化器状态。 |
| 意义 | ⭐ 本期最重要的论文——揭示了嵌入层独特的梯度几何,并据此设计了极轻量级的替代优化器。如果成立,大模型的 Embedding 和 LM-head 可以不再使用 Adam,从而大幅降低优化器内存开销。 |
🔥 2. ZO-Act:激活引导的零阶优化微调(2607.01125)
| 维度 | 详情 |
|---|---|
| 论文 | 2607.01125 |
| 提交 | 2026年7月(2607前缀) |
| 核心 | 零阶(Zeroth-Order)优化在反向传播不可用或内存受限时微调 LLM。ZO-Act 通过输入激活构建固定低秩子空间,仅优化轻量系数矩阵。 |
| Adam 兼容 | 支持动量优化器(如 Adam)作为系数优化器,弥补了 ZO 方法通常不支持动量/SGD 之外的优化器的短板。 |
| 验证 | Llama-3-8B, OPT-13B, INT4 Llama-3-8B 上优于强 ZO 基线 |
| 意义 | 将 Adam 这类主流优化器的动量机制引入 ZO 微调,为资源受限场景提供了新选择。 |
📊 大模型优化器(仅限此前未覆盖的新内容)
🟢 SCAPE:基于 AdamS 一阶动量稳定性的极端稀疏通信(2607.01678)
| 维度 | 详情 |
|---|---|
| 论文 | 2607.01678 |
| 提交 | 2026年7月2日 |
| 作者 | Mingkai Zheng, Junlin Chen, Haotian Xie, Zhao Zhang |
| 核心 | 通信开销在分布式 LLM 训练中日益主导总成本。现有方案(稀疏梯度、量化)在高稀疏度下对 Adam 类优化器不稳定。SCAPE 利用 AdamS 的一阶动量稳定性来实现激进稀疏化:遮罩来自一阶动量统计而非原始梯度,跨 worker 分区生成遮罩以对齐优化器分片,延迟遮罩使用一个 step 以与计算重叠。 |
| 意义 | 与上期 DMuon(优化器本身)和 HiMuon(计算加速)互补——从通信角度解决分布式训练瓶颈。 |
🟢 Beyond Adam: SOAP 和 Muon 在材料科学中的跨域验证(2607.02499)
| 维度 | 详情 |
|---|---|
| 论文 | 2607.02499 |
| 提交 | 2026年7月2日 |
| 作者 | Gil Harari 等(含 Boris Kozinsky) |
| 核心 | 将 SOAP 和 Muon 系统应用于机器学习原子间势(MLIPs) 训练——这是 SOAP/Muon 首次在材料科学领域被系统验证。此前该领域默认使用 Adam。 |
| 意义 | SOAP 和 Muon 正在从 LLM 社区向科学计算领域跨域扩散,验证了这些优化器的通用性。 |
🟢 Fourier Preconditioning for Neural Feature Learning(2607.02199)
| 维度 | 详情 |
|---|---|
| 论文 | 2607.02199 |
| 提交 | 2026年7月2日 |
| 核心 | H-Score 目标函数在约束逼近类下对输入基旋转敏感。提出使用 FFT 作为数据无关、低成本的预条件,用于近似平稳过程的特征学习网络。 |
| 意义 | 预条件技术的新方向——将信号处理中的时频分析用于优化器预条件。 |
🟢 Lower Bounds for Anytime Acceleration of Gradient Descent(2607.02053)
| 维度 | 详情 |
|---|---|
| 论文 | 2607.02053 |
| 提交 | 2026年7月2日 |
| 核心 | 为 GD 的任何时候收敛(anytime convergence) 建立首个下界:函数值收敛无法达到 o(n^{-1.334}),平方梯度范数无法达到 o(n^{-1})。解答了 COLT 2024 的开放问题。 |
| 意义 | 优化理论的基础突破——回答了”GD 在不知道总迭代次数的情况下最快能多快”这个近两年的开放问题。 |
🟢 DeadPool:零开销热插拔 LLM 训练容错(2607.01646)
| 维度 | 详情 |
|---|---|
| 论文 | 2607.01646 |
| 提交 | 2026年7月2日 |
| 核心 | 故障节点热替换(hot-swapping),无需终止作业。关键技术:离线关键路径内存检查点 + 通信器重建协议。 |
| 意义 | LLM 大规模训练的基础设施改进,虽非优化器本身但直接影响训练稳定性。 |
🟢 SOAP / Shampoo / AdamW 方向
本期无直接的新方法论文。 但 SOAP 和 Muon 在 MLIPs(材料科学)的跨域验证(2607.02499)值得关注——SOAP 社区仍在持续输出应用成果而非新理论。
🟢 Muon 方向
本期无新的 Muon 理论或改进论文。 上期 Muon 的大量新作(DDC, DMuon, HiMuon, MD Decoupling, Tensorion, 矩阵分解动力学)之后进入消化期。Muon 在 MLIPs 中的应用(2607.02499)是本期唯一的 Muon 相关进展。
🔄 流形优化(仅限此前未覆盖的新内容)
🟢 Geometry-Adaptive Regularized Newton-Type Method for Manifold-Affine Intersection Problems(2606.31738)
| 维度 | 详情 |
|---|---|
| 论文 | 2606.31738 |
| 提交 | 2026年6月30日 |
| 核心 | 提出 Regularized Newton-SLRA (RN-SLRA)——用于局部流形-仿射交问题的正则化牛顿法。经典 Newton-SLRA 在横截性失效时(切空间交步骤病态/奇异),RN-SLRA 用正则化二次子问题替代精确切空间交步骤。在内在横截性下证明线性收敛,横截性下取得高阶收敛。含基于准最优流形投影的 inexact 变体。 |
| 意义 | ⭐ 本期唯一流形优化新论文。 解决的是结构化低秩逼近中的经典难题——当横截性条件不满足时牛顿法失效的补救方案。数学上属于流形优化在矩阵逼近问题中的应用。 |
🟢 其他方向
| 方向 | 状态 |
|---|---|
| DDC 后续 | 上期重点报道的 DDC(规范等变预条件,2606.29176),本期未出现跟进或改进工作。 |
| SpinGTP (2607.01408) | E(3)-等变网络用自旋加权球谐函数,属于几何深度学习但不属于严格意义上的流形优化。 |
| 传统黎曼 SGD/Adam | 本期无新增。 |
| 流形优化 × LLM 交叉 | 无新论文——DDC 仍是该方向最前沿的工作。 |
趋势观察:流形优化方向持续静默(仅 2606.31738 一篇可算)。几何思想继续被主流优化器社区吸收(Token Geometry 的 1D ray 发现是最新例证),但以”流形优化”本身名义发表的工作持续减少。
💡 讨论与趋势
1. 「Token Geometry」—— 嵌入层的隐藏结构
Token Geometry 的发现(2607.01455)可能是本期最容易被低估的工作。它指出:
- 嵌入层/LM-head 的梯度几何截然不同于密集权重。这意味着我们一直用 Adam 统一优化所有参数,可能是次优的。
- 优化轨迹是简单的 1D ray——这挑战了”神经网络在高度非凸景观中导航”的主流叙事。
- Ember 的 O(V+D) vs Adam 的 O(2VD)——对百亿参数模型来说,词表 128K × 维度 8192 = 1B 参数的嵌入层,Adam 需要 2×2GB=4GB 优化器状态,Ember 仅需约 130KB。
如果 Ember 在大规模上得到验证,嵌入层的优化器内存开销可以忽略不计。
2. 优化器生态进入「应用扩散」期
本期的一个显著特征是缺乏全新的优化器架构——相比前几期(Muon 家族连续爆发、DDC、MD Decoupling 等),本期更偏向:
- 已有方法的跨域验证(SOAP/Muon → 材料科学,2607.02499)
- 现有方法的工程改进(SCAPE 的通信优化、DeadPool 的容错)
- 基础理论的深化(GD 任何时候收敛下界)
3. SOAP 和 Muon 的跨领域渗透
本期 MLIPs 领域的论文(2607.02499)是 SOAP/Muon 从 LLM 训练走向科学计算的标志性工作。Boris Kozinsky(哈佛材料科学教授, SOAP 的共同作者)领导该研究,表明优化器社区的创新正在改变其他学科的训练实践。
4. 下期关注
- Ember (Token Geometry) 是否有仓库公开及大规模 LLM 复现
- ZO-Act 在更大模型上的验证
- SCAPE 在大规模分布式训练中的实测数据
- DDC 社区跟进情况——是否有复现或批评
- Muon 社区下期是否会有新理论突破
- 流形优化方向是否会有新论文出现
✅ 报告完成