🔬 大模型优化器 & 流形优化日报
覆盖日期:2026年7月7日 – 7月10日
上期成功报告:2026年7月7日
本期执行:2026年7月10日
📌 本期重点
🔥 1. MatrixFSDP:让 Muon 在 ZeRO-3 分片下无通信开销(2607.05895)
| 维度 |
详情 |
| 论文 |
2607.05895 |
| 提交 |
2026年7月7日 |
| 作者 |
Ming Gao, Yanwu Xu, Hao Zhang |
| 核心问题 |
Muon 等矩阵优化器需要完整的 2D 矩阵作为输入,但 FSDP/ZeRO-3 让优化器只能看到分片——传统方案要么重建矩阵(引入额外通信),要么使用 ZeRO-1 驻留(内存开销大) |
| 方案 |
MatrixFSDP 改变 ZeRO-3 的分片布局:每个 2D 权重由一个 rank 拥有完整矩阵,其余 rank 持有空分片;反向传播后完整梯度自然落在 owner 上,Newton-Schulz 本地执行,零优化器步矩阵通信 |
| 效果 |
64×A100 上,优化器步延迟相比 stock FSDP2-Muon 降低 4.2×(单节点) 和 54.6×(八节点),端到端加速 2.15×;支持 ZeRO-1 驻留放不下的更大模型 |
| 意义 |
⭐ 本期最重要的工程贡献——直接移除了 Muon 在 FSDP 下推广的最大障碍。MatrixFSDP 可以无缝替换现有 FSDP2-Muon 实现,无需改动优化器本身的数学 |
🔥 2. ELO:高效长视野元学习优化器——超越 AdamW、对标 Muon(2607.06772)
| 维度 |
详情 |
| 论文 |
2607.06772 |
| 提交 |
2026年7月7日 |
| 作者 |
Xiaolong Huang, Benjamin Thérien, James Harrison, Eugene Belilovsky |
| 核心 |
元学习优化器(Learned Optimizer)长期面临两个困难:(1) 无法高效扩展元训练到长内循环问题;(2) 难以超越手工设计的优化器。ELO 提出两个关键技术:(a) 将冗余元训练计算重新分配到「长失效区间」,实现高效长视野学习;(b) 解耦渐进式专家监督,提供稳定的元学习信号 |
| 效果 |
GPT-2 124M/350M (FineWeb) + ViT-B/16 + ResNet-50 (ImageNet-1K) 上,ELO-Celo2 一致优于调优 AdamW,在语言建模上与 Muon 竞争。全部元训练 <7 H100 GPU-hours |
| 意义 |
元学习优化器首次以极低成本(<7 H100-hours)达到实际可用水平——如果推广,可能改变「手工设计-元学习」的权衡 |
📊 大模型优化器(仅限前几期未覆盖的新内容)
🟢 Full-Stack FP4:首个完整的 4-bit LLM 预训练框架(2607.04422)
| 维度 |
详情 |
| 论文 |
2607.04422 |
| 提交 |
2026年7月5日 |
| 作者 |
Siyu Ding, Mingchuan Ma, Jiabo Tong, Xingrun Xing, Ziming Wang, Guoqi Li |
| 核心 |
前人 NVFP4 训练仅聚焦线性层,忽略了优化器状态、优化器算术和注意力。Full-Stack FP4 是首个完整的 NVFP4 预训练框架:(1) 线性层用 LoRA-SVD 分解抑制量化噪声,损失差距从 1.40% 缩至 0.61%;(2) AdamW 二阶矩做 NVFP4 兼容的数值变换,原生支持 NVFP4 Newton-Schulz 迭代(Muon 优化器);(3) 注意力用混合精度方案保护脆弱路径 |
| 效果 |
3B/64B-token 预训练与 BF16 的损失差距仅 1.47% |
| 意义 |
Muon 的 Newton-Schulz 迭代首次被纳入 4-bit 预训练框架——这意味着在低精度硬件上也能高效使用 Muon |
🟢 GIFT:几何感知的低精度梯度通信(2607.07494)
| 维度 |
详情 |
| 论文 |
2607.07494 |
| 提交 |
2026年7月8日 |
| 作者 |
Jieying Wang, Shuyuan Fan, Mingkai Zheng, Zhao Zhang |
| 核心 |
FP8/NVFP4 低精度梯度通信在高度各向异性的梯度上会产生方向依赖的扭曲。GIFT 将梯度先变换到近各向同性空间再做低精度通信,使低精度表示更忠实于高精度版本。仅改变坐标系,不改优化器/训练配置/通信集合 |
| 效果 |
Llama-600M 在 64×GH200 上端到端预训练时间减少 7.6%,同时下游任务保持率优于直接欧氏空间 FP8 通信 |
| 意义 |
与上期 SCAPE 互补——SCAPE 从稀疏化角度优化通信,GIFT 从几何预条件角度优化量化本身 |
🟢 On the Convergence of Adam, Revisited(2607.03519)
| 维度 |
详情 |
| 论文 |
2607.03519 |
| 提交 |
2026年7月3日 |
| 核心 |
证明在线优化的 Projected Adam 在任意动量参数 β₁,β₂∈[0,1) 下可以有有界平均遗憾远离零。改进了 Reddi-Kale-Kumar (2018) 需要 β₁<√β₂ 的约束 |
| 意义 |
Adam 收敛性理论的又一完善——回答了「Adam 是否在所有参数设置下都保证收敛?」的新片段 |
🟢 其他方向
| 方向 |
状态 |
| SOAP/Muon 跨域 |
上期已报道 MLIPs (2607.02499),本期新增 MatrixFSDP 工程优化 + Full-Stack FP4 中的 Muon Newton-Schulz 量化支持 |
| Muon 理论 |
本期无纯理论新论文(「Muon as Residual Connection」等已在上期覆盖) |
| AdamW 改进 |
Full-Stack FP4 在 4-bit 精度下实现 AdamW;Convergence of Adam Revisited 是理论完善 |
| 二阶优化 |
本期无新增 |
| 元学习优化器 |
ELO (2607.06772) 是重要新进展——见本期重点 |
| 分布式通信 |
MatrixFSDP + GIFT 两个互补方向——MatrixFSDP 消除矩阵通信,GIFT 优化量化通信 |
趋势观察:本期没有全新的优化器数学设计(如 Muon 或 SOAP),但工程与系统优化出现密集进展——MatrixFSDP(FSDP 适配)、Full-Stack FP4(4-bit 量化)、GIFT(几何感知通信)三个独立工作分别从不同角度推动优化器在大规模训练中的实际部署。
🔄 流形优化(仅限前几期未覆盖的新内容)
🟢 本期重点:Optimization Geometrodynamics(2607.06723)
| 维度 |
详情 |
| 论文 |
2607.06723 |
| 提交 |
2026年7月7日 |
| 作者 |
Zavier Li(单人) |
| 核心 |
提出优化几何动力学框架:优化 = 参数轨迹 + 输运粒子分布 + 时变黎曼度量三者的耦合演化。引入「动态几何复杂度」概念——最小化优化难度可观测量的最小几何代价,在强凸二次目标+全正定度量控制的 oracle 基准模型下,该复杂度恒等于相对对数谱到低条件数集合的仿射不变距离 |
| 内容 |
Hessian 匹配流、谱 Onsager 弛豫、离散指数投影更新、规范不变可观测量。纯理论论文 |
| 意义 |
⭐ 本期最重要的理论贡献——为优化器的几何理解提供了一个统一的语言框架。将动态度量、粒子输运和参数演化统一在一个微分几何形式体系下 |
🟢 RNC-LM:黎曼正规坐标下的高阶 Levenberg-Marquardt(2607.07623)
| 维度 |
详情 |
| 论文 |
2607.07623 |
| 提交 |
2026年7月8日 |
| 作者 |
Jianing Liu, Dong H. Zhang |
| 核心 |
非线性最小二乘优化天然具有几何解释——模型预测形成数据空间中的流形。标准 LM 的切空间步在参数坐标中应用为直线更新,忽略参数效应曲率。RNC-LM 利用黎曼正规坐标将测地加速度扩展到任意阶修正,构造有限步更新,逐步消除残差加速度的切向分量 |
| 效果 |
经典非线性最小二乘基准上提升弯曲谷和秩亏问题的收敛性;反应扩散 PINN 失败模式下 L2 误差降至 1e-3 级别;大规模 ML 势能面拟合任务上实现标准 LM 的 34 倍加速 |
| 意义 |
将黎曼几何工具(正规坐标、测地线)嵌入经典优化器LM,在物理/化学 ML 应用中获得巨大加速——是流形优化向科学计算渗透的优秀案例 |
🟢 Intrinsic Green’s Learning:流形上的监督学习(2607.07034)
| 维度 |
详情 |
| 论文 |
2607.07034 |
| 提交 |
2026年7月8日 |
| 作者 |
Alexandre Quemy |
| 核心 |
提出本征格林学习(IGL) 框架:将流形上的目标函数建模为线性 PDE 的解,源项从数据中学习。编码器发现流形上的低维坐标图,源和核分解为低秩张量,将高维积分坍缩为独立的一维积分(成本线性于本征维数) |
| 地位 |
ICLR 2026 AI & PDE Workshop 接收 |
| 意义 |
从逆 PDE 角度处理流形学习——范式上独特,且自动恢复流形本征维度 |
🟢 其他流形优化新论文
| 论文 |
日期 |
摘要 |
| GRiLS:Gradient-free Riemannian Langevin Sampler (2607.07519) |
7月8日 |
无需目标密度梯度的高效黎曼 Langevin 采样器,用黎曼度量重塑局部几何以跨越模式,适合导数不可用或昂贵的复杂目标 |
| FlatManifold:流形展平的鲁棒持续学习 (2607.05201) |
7月6日 |
用 Nyström 流形展平映射 + 正交化 RKHS 投影,在 40% 标签噪声和跨域漂移下持续学习。证明「结构线性化本身即是对抗分布标签损坏的数学屏障」 |
| Geometric–Nongeometric Optimizer Calculus (2607.07206) |
7月8日 |
优化器的模块化审计语言:将自适应优化器拆分为「几何模块」(度量/预条件器)和「非几何模块」(估计/记忆/步长/约束/随机性),在显式预算和约束下分析可达梯度方法 |
🟢 方向汇总
| 方向 |
状态 |
| 流形优化 × LLM 交叉 |
本期无直接交叉论文。但 MatrixFSDP 和 GIFT 均使用了「几何感知」思想来改进优化器的分布式训练 |
| 流形优化新理论框架 |
Optimization Geometrodynamics 是重要的理论进展 |
| 流形优化 × 科学计算 |
RNC-LM 在 ML 势能面拟合上实现 34× 加速,是几何优化在科学 ML 中的亮眼应用 |
| 黎曼采样 |
GRiLS 是黎曼几何与贝叶斯采样的新交叉 |
趋势观察:流形优化方向在本期出现了两个显著变化:(1) 理论框架的统合——Optimization Geometrodynamics 和 Geometric–Nongeometric Calculus 不约而同地尝试为优化器建立几何语言;(2) 几何思想向工程渗透——GIFT 和 MatrixFSDP 用「各向同性」、「几何感知」等概念改进分布式训练,不再是纯理论推演。
💡 讨论与趋势
1. 【趋势研判】Muon 的「工程之墙」正在被系统性地拆除
Muon 从理论诞生到今天面临的最大阻碍从来不是数学,而是工程落地。本期却密集出现了三篇系统工程论文:
| 问题 |
本期工程解 |
| FSDP 无法做矩阵优化器 |
MatrixFSDP(重排分片布局,零通信开销) |
| 4-bit 量化不支持 Newton-Schulz |
Full-Stack FP4(原生 NVFP4 Newton-Schulz 迭代) |
| 低精度梯度通信扭曲方向 |
GIFT(几何感知坐标变换) |
这三篇的叠加效应是:Muon 的大规模部署路径正被逐一打通。尤其 MatrixFSDP 可能是下半年最值得被 LLM 训练框架集成的工程工作。
2. 元学习优化器再次证明「可能超越手工设计」
ELO 的突破性在于:以 <7 H100 GPU-hours 的元训练成本,产出了胜过 AdamW、对标 Muon 的优化器。此前元学习优化器长期被认为「成本高、效果弱」。如果这一方向持续突破,未来可能走向「LLM 的优化器本身也是学习的」。
3. 优化理论的「几何语言化」趋势
本期出现两个独立的理论框架(Optimization Geometrodynamics 和 Geometric–Nongeometric Calculus)都在尝试为优化器建立形式化的几何语言。这预示着该领域可能正在从「经验设计」走向「公理体系」——虽然这些框架目前还难以直接指导实践,但它们为理解优化器的设计空间提供了形式化工具。
4. 下期关注
- MatrixFSDP 是否有开源实现及其在 Llama-scale 上的实测
- ELO 元学习优化器的权重是否公开
- Full-Stack FP4 的开源代码
- RNC-LM 是否有 PyTorch 集成
- Optimization Geometrodynamics 社区反响
- 7月10-13日 arXiv 新提交窗口的下一批工作
✅ 报告完成:文件已保存至 ~/hermes-reports/2026-07-10-llm-optimizer-manifold-daily.md。