大模型优化器 & 流形优化日报 — 2026年7月25日

大模型优化器 & 流形优化日报 — 2026年7月25日

🔬 大模型优化器 & 流形优化日报

覆盖日期:2026年7月22日 – 7月25日 上期成功报告:2026年7月22日 本期执行:2026年7月25日


📌 本期重点

🔥 1. SkewAdam:MoE 训练的 Tiered 优化器状态分配——用 2.6% 的优化器状态实现更好训练(2607.19058)

维度 详情
论文 2607.19058 — “Where Should Optimizer State Live?”
提交 2026年7月21日
作者 Nuemaan Malik(单人)
核心洞察 MoE 模型有三类参数种群:Dense Backbone(占参数 5%)Experts(95%)Router(<0.01%),它们的梯度统计差异极大,不应使用相同的优化器状态。AdamW 在 6.78B MoE 上保留 50.6 GB 的 1st/2nd moments 来更新 12.6 GB 的 bfloat16 权重,极度浪费
方法 提出 SkewAdam 分层策略:Backbone → float32 动量 + factored 2nd moment;Experts → 仅 factored 2nd moment(95% 参数);Router → 精确 2nd moment
效果 优化器状态仅 1.29 GB(AdamW 的 2.6%),峰值训练内存从 81.4 GB → 31.3 GB(一台 40 GB 加速器即可训练)。在 82M token 的受控比较中,SkewAdam 达到验证 PPL 108.4,超越 AdamW (126.8)、Muon (120.2)
意义 开创了「异构分发优化器状态」的新范式——证明不同参数种群对优化器精度需求天然不同,分层分配可在大幅降低内存的同时提升性能

🔥 2. 谱帽(Spectral Cap)修正 Muon 的各向异性漂移 —— 理论基础与三个案例(2607.19771)

维度 详情
论文 2607.19771
提交 2026年7月22日
作者 Jiachun Li(单人)
核心发现 在尺度不变假设下(规范化网络近似成立):SGD 自带 1/||W|| 更新刹车;Muon 的矩阵符号去除了这个刹车,导致 Frobenius/spectral norm 以 t^1/2(vs SGD t^1/4)更快向外漂移。进一步,谱范数扰动存在非负二阶项
方案 提出轻量级 Spectral Cap——仅投影出每个更新中最大奇异方向的一阶增长。本质上是一个几何正则化:控制输出协方差 W K_X W^T 而不冻结训练(权重通过非最大方向继续学习)
意义 首次从理论层面解释 Muon 的谱范数漂移问题并提出可操作的修复方案——对 Muon/SOAP 家族的大规模训练稳定性有直接影响

📊 大模型优化器(仅限新内容)

🟢 ISO:RLVR 原生优化栈——谱继承驱动的等谱优化(2607.19331)

维度 详情
论文 2607.19331
提交 2026年7月21日
作者 Hanqing Zhu, Wenyan Cong, Zhizhou Sha et al.(UT Austin / Meta / Intel 等)
核心发现 发现 RLVR(带可验证奖励的强化学习)存在谱继承现象:RLVR 复用基础模型的权重谱(singular values),只修改对应的输入/输出奇异框架(singular frames)来学习新行为
方法 提出 ISO(Isospectral Optimization) 框架,将谱继承操作化为固定谱的优化方案。包含两个变体:(1) ISO-Merger(离线):合并多个共享基础的专家模型的框架变化,无需后合并数据、rollouts 或 on-policy distillation;(2) ISO-Adapter(在线):用于 RLVR 训练本身的等谱适配器
意义 首次揭示 RLVR 优化层的行为模式——将「RLVR 如何更新权重」从黑盒变为可解释的谱操作。ISO-Merger 可能是多专家融合的实用轻量方案

🟢 StatLoRA:统计假设检验驱动的 LoRA 秩分配(2607.20205)

维度 详情
论文 2607.20205
提交 2026年7月22日
作者 Yihang Gao, Vincent Y. F. Tan(NUS)
核心 将 LoRA 秩分配形式化为统计假设检验问题。每个 LoRA 组件关联一个检验统计量,用估计的 p-value 决定哪些组件在给定秩预算下保留或剪枝。提供随机梯度中心极限定理作为理论基础
意义 🎯 秩分配从启发式重要性分数升级为有统计置信度保障的决策——更可解释、理论上更牢靠

🟢 M+Adam:加法-乘法混合低精度训练(2607.10611 v2,7月14日更新)

维度 详情
论文 2607.10611v2
提交 7月12日(v2 7月14日更新,本期首次覆盖)
作者 Xiaoyuan Liang, Sebastian Loeschcke, Mads Toftrup et al.
核心 低精度训练中,加性噪声在小数值幅度时占主导,乘性噪声在极端值时占主导。M+Adam 根据梯度幅度自动在加性和乘性更新之间切换:小梯度使用高精度加性更新,大梯度使用量化友好的乘性更新
意义 对 FP4/FP8 训练中的噪声管理提供了新的混合精度策略

🟢 方向汇总

方向 状态
Muon 理解与修复 Spectral Cap 提供 Muon 谱漂移的理论解释和可操作修复方案
MoE 优化器内存压缩 SkewAdam 用 2.6% 状态超越 AdamW + Muon,开辟新方向
RLVR 优化栈 ISO 首次将 RLVR 权重更新建模为等谱优化
LoRA 秩分配 StatLoRA 用统计假设检验提供置信度保障的秩分配
低精度训练 M+Adam 的加性-乘性混合策略
学习优化器 / 预条件器理论 本期无新增内容
LR 调度 / Cooldown 本期无新增内容

本期趋势:两个新方向同时涌现——(1) 异构优化器状态分配(SkewAdam 证明 MoE 的 3 类参数需要不同的优化器精度);(2) RLVR 的谱分析(ISO 揭示 RLVR 的谱继承本质)。Spectral Cap 则延续了上期「Muon 几何理解」的脉络。值得注意的是,本期几乎所有工作都是单人作者或小型团队产出。


🔄 流形优化(仅限新内容)

🟢 去中心化在线黎曼优化——强测地凸函数的首个 O(log T) 遗憾界(2607.20316)

维度 详情
论文 2607.20316
提交 2026年7月22日
作者 Zhanyuan Cai, Emre Sahinoglu, Shahin Shahrampour(Texas A&M)
核心 首次研究去中心化在线黎曼优化中强测地凸损失的问题。主要挑战:集中式所需的衰减步长与现有网络误差分析(通常假设固定步长)不兼容。贡献:(1) 提供时变步长的通用网络误差分析;(2) 导出去中心化在线黎曼梯度下降的首个 O(log T) 静态遗憾界,匹配欧氏最优极小化速率;(3) 扩展到动态遗憾场景
意义 ⭐ 填补了去中心化黎曼优化中「强凸」场景的理论空白——对分布式传感器网络、多智能体系统等应用有意义

🟢 其他流形优化方向

方向 状态
黎曼多级优化(2607.09517) 已在上期(7月16日)首次报道
仿射-横截 Hilbert 子流形优化(2607.10861) 已在上期首次报道
分布式因子图流形求解器(2607.08735) 已在上期首次报道
流形优化 × 大模型 RL(RIPO) 上上期重点报道,本期无后续
本期新增 去中心化在线强凸黎曼优化(2607.20316)

💡 讨论与趋势

1. 优化器状态分配的「精准营养」时代

从 AdamW 对所有参数一视同仁保留 50.6 GB 状态,到 SkewAdam 根据不同参数种群分配 1.29 GB 且 PPL 更优,这标志着优化器设计从「大一统」走向「按需分配」——每类参数获得其真正需要的优化器精度。

2. RLVR 优化正在从工程试错走向可分析的理论

ISO 论文揭示的「谱继承」现象表明,RLVR 训练并非随机更新权重,而是遵循特定的谱操作规律。这与上期 Muon 的表示几何(Muse)一脉相承——优化器行为正越来越多地被谱/几何语言描述。

3. Muon 的「暗面」开始浮现

本期 Spectral Cap 发现 Muon 存在谱范数失控漂移问题,结合上期 Reassessing Muon(Muon 在受控问题上并不一致优于 AdamW),正在形成对 Muon 的更平衡认知——它的优势需要特定的谱/几何条件,且伴随副作用。

4. 下期关注

  1. SkewAdam 是否在更大规模 MoE(100B+)和更长训练中保持领先
  2. Spectral Cap 的实际应用——是否有社区或主流框架集成
  3. ISO 的谱操作是否能在多轮 RLVR 训练中持续稳定
  4. StatLoRA 的 p-value 选择是否对超参数敏感
  5. 7月22日至25日 arXiv 更新窗口(含周一)的新提交

已存档:~/hermes-reports/2026-07-25-llm-optimizer-manifold-daily.md,INDEX.md 已更新,个人主页已同步。