大模型优化器 & 流形优化日报 — 2026年5月7日
大模型优化器 & 流形优化日报 — 2026年5月7日
大模型优化器 & 流形优化日报
日期:2026-05-07 | 覆盖区间:2026-05-05 ~ 2026-05-07
上期报告:2026-05-04 日报
📌 本期是五一假期后 arXiv 恢复入库的首批新论文。本期内容量大幅回暖,出现多个重要新工作。前几期已报道内容(SOAP收敛证明、Newton-Muon、ZipCCL、FADE、Cost-Aware Learning、Nonsmooth Riemannian等)不再重复。
📌 本期重点(最值得关注)
🔥 1. Nora:统一矩阵优化器的新范式(2605.03769)
本周最重磅的优化器新工作。Nora(Normalized Orthogonal Row Alignment)试图一举解决矩阵型优化器(Muon/Shampoo/SOAP)的三大核心矛盾: - 效率:Muon 级预处理加速 - 稳定性:严格满足神经网络的尺度不变性(scale-invariance) - 速度:计算复杂度 O(mn),远低于 Muon
核心创新:通过行级动量向权重正交补空间投影,同时稳定权重范数和角速度。利用 Transformer Hessian 的分块对角优势近似结构化预处理。作者还证明了 Nora 的缩放定理(scaling theorems),实现仅需两行代码。
此前日报报道了 Muon²、Mousse、Mano、Newton-Muon 四个 Muon 变体。Nora 不属于 Muon 家族,而是另起炉灶的新范式——它从”矩阵优化器应该满足什么条件”出发重新设计。
- 📄 arXiv: https://arxiv.org/abs/2605.03769
🔥 2. MEAZO:颠覆零阶优化常识(2605.03869)
这篇论文直接挑战了 ZO-Adam 优于 ZO-SGD 的主流观点。
核心发现:在高维 LLM 场景中,ZO 梯度缺乏坐标异质性——自适应机制(如 Adam 的二阶矩估计)无法提供收敛优势,反而增加内存开销。
解决方案:MEAZO —— 仅追踪单个标量进行全局步长自适应,内存占用与 ZO-SGD 相同,性能与 ZO-Adam 打平。在多种 LLM 家族和任务上验证,且对步长选择更鲁棒。
这与上期 ZO for Riemannian 论文(2604.26913)形成呼应——零阶方法正在经历一轮”去虚火”式的重新评估。
- 📄 arXiv: https://arxiv.org/abs/2605.03869
📊 大模型优化器
新论文
| 论文 | 日期 | 要点 |
|---|---|---|
| Nora arXiv:2605.03769 | May 5 🆕 | 🔥 新一代矩阵优化器,统一效率/稳定性/速度三大要求,O(mn) 复杂度,可证明的缩放定理 |
| MEAZO arXiv:2605.03869 | May 5 🆕 | 🔥 挑战 ZO-Adam:高维 LLM 中自适应零阶方法无优势,提出标量级自适应 ZO 优化器 |
| ZO Learning Dynamics arXiv:2605.03373 | May 5 🆕 | 从核视角解释 ZO 方法在 LLM 上的成功——eNTK 由扰动数而非参数维度决定,提供维度无关的理论保障 |
| FiBeR arXiv:2605.03363 | May 5 🆕 | 差分隐私优化器:修正时序滤波后的 DP 噪声偏差,提出滤波器感知的二阶矩校准,在视觉和语言任务上超越现有 DP 优化器 |
| LoRA Rank Threshold arXiv:2605.03724 | May 5 🆕 | 理论上将 LoRA 微调的二分类任务所需秩从 r≥12 降至 r=1,在 GLUE 四任务上验证 |
趋势观察
-
矩阵优化器进入”第二代”:Nora 的出现标志着矩阵优化器从”Muon vs SOAP vs Shampoo”的经验对比,进入了一个更系统的设计阶段——从第一性原理出发定义优化器应满足的条件,然后推导结构。这种思路类似从 Adam 到 AdamW 的演变。
-
零阶优化的理论觉醒:本期三篇零阶相关论文(MEAZO、ZO-Kernel、上期 ZO for Riemannian)共同指向一个方向——ZO 方法的理论理解正在快速追赶其工程实践。尤其是 ZO-Kernel 的”扰动数决定精度而非参数维度”结论,为 LLM 零阶微调提供了坚实的理论基础。
-
差分隐私优化器精细化:FiBeR 是 DP-SGD 在时序滤波场景下的专门优化器。此前日报讨论了隐私保护与训练效率的权衡,FiBeR 在这个方向上提供了新的工程工具。
🔄 流形优化
新论文
| 论文 | 日期 | 要点 |
|---|---|---|
| Riemannian Geometry Monograph arXiv:2605.02279 | May 4 🆕 | 🔥 143 页实现导向专著,系统推导黎曼几何基础(切空间、度量张量、Levi-Civita 联络、曲率、测地线),专项覆盖 Stiefel/Grassmann/SPD 流形的显式公式 |
| Ball-proximal on Hadamard arXiv:2605.03815 | May 5 🆕 | Hadamard 流形上的 ball-proximal 点方法,引入黎曼 broximal 映射,证明存在唯一性和 KKT 特征 |
| Flow Matching on Riemannian Symmetric Spaces | May 5 🆕 | 在黎曼对称空间(球面、双曲空间、Grassmannian)上训练流匹配模型,利用李代数结构线性化问题 |
| Flow Sampling on Manifolds | May 5 🆕 | 扩散模型采样推广到黎曼流形,推导常曲率流形(超球面、双曲空间)上条件漂移的闭式公式,应用于分子构象生成 |
| Stochastic Schrödinger Diffusion | May 5 🆕 | 复射影空间(Fubini-Study 度量)上的 score-based 生成模型,量子表示学习数据增强 |
| Proximal Splitting in Metric Spaces | May 5 🆕 | 一致凸度量空间上 proximal 分裂算法的定量收敛,SPD 流形 Fréchet 均值计算为应用案例 |
| S-RAS: SPD Alignment | May 5 🆕 | 基于 SPD 流形的谱黎曼对齐分数,用于比较神经网络表示 |
趋势观察
-
黎曼几何”实用化”加速:本期 143 页专著(2605.02279)填补了从微分几何理论到数值实现的鸿沟。加上上期的”Nonsmooth Riemannian with Inexact Primitives”(2604.27078),流形优化从”需要精确指数映射”到”允许近似 retraction”的实用化转型正在系统化。
-
生成模型 × 流形形成新热点:本期至少三篇论文在流形上进行扩散/流匹配生成——黎曼对称空间流匹配、Flow Sampling on Manifolds、复射影空间 Schrödinger 扩散。这表明“在正确几何空间上做生成”正成为一个可操作的研究方向,而非纯理论构想。
-
与 LLM 训练的直接交叉仍待突破:本期流形优化论文集中于 math.OC / cs.LG / 生成模型方向,仍未出现”流形约束优化器直接用于 LLM 训练”的工作。这个交叉点(如黎曼 Adam 的 LLM 级应用)依然是待开垦的处女地。
💡 讨论 / 观点
社区动态
- 本期论文均为新鲜出炉(5月5日提交),arXiv 讨论、HN、Reddit、中文社区暂未出现相关讨论。预计下期(5 月 10 日)将出现首批社区反馈。
值得关注的趋势信号
-
Nora 会否引发”矩阵优化器统一理论”竞赛? Nora 明确将”效率/稳定性/速度”列为矩阵优化器的三大公理要求,并试图一次性满足所有条件。如果后续出现大规模实验验证(1B+ 参数级别),这可能会重塑社区对”最优 LLM 优化器”的认知。
-
ZO 方法的”冷静期”:MEAZO 的核心信息是”ZO-Adam 并不比 ZO-SGD 好”——这可能会让一些跟进 ZO-Adam 的工作重新审视实验设计。配合 ZO-Kernel 的理论分析,零阶优化方向正在经历从 hype 到理解的转变。
-
DP 训练的工具链完善:FiBeR 解决的是 DP 训练中一个非常具体的工程问题(时序滤波引入的偏差),这表明 DP 训练正在从”能用”走向”好用”的阶段。
📋 下期预告
下一期计划于 2026-05-10 运行。重点关注: - Nora 和 MEAZO 的首批社区讨论 - 5 月 6-9 日 arXiv 新提交(今日已提交但尚未公示的论文) - 流形优化与 LLM 训练交叉的突破(期待!)
| *报告生成时间:2026-05-07 08:00 CST | 下次运行:2026-05-10 08:00 CST* |