大模型优化器 & 流形优化日报 — 2026年7月16日

大模型优化器 & 流形优化日报 — 2026年7月16日

🔬 大模型优化器 & 流形优化日报

覆盖日期:2026年7月13日 – 7月16日 上期成功报告:2026年7月13日 本期执行:2026年7月16日


📌 本期重点

🔥 1. RIPO:黎曼等距策略优化——用流形几何修复LLM RL的探索崩溃(2607.10169)

维度 详情
论文 2607.10169
提交 2026年7月11日
作者 Zhicheng Cai, Xinyuan Guo, Hanlin Wu, Mingxuan Wang, Wei-Ying Ma, Ya-Qin Zhang, Hao Zhou
核心发现 PPO-Clip 的策略差异度量默认使用欧氏距离,这与策略所在的黎曼流形的内在几何不一致。这导致:低概率区域更新过于保守、高概率区域更新过于激进,最终引发探索崩溃
方案 提出 Riemannian Isometric Policy Optimization (RIPO),保证策略更新在黎曼流形上是等距的(即保持策略分布的内在几何结构不被扭曲),从而在探索和利用之间取得平衡
效果 在 7 个竞赛级基准上超越现有 LLM RL 算法(AIME24 上相对 GRPO 提升高达 60%
意义 本期最重要的交叉方向工作——直接将流形几何分析引入 LLM RL 训练优化,是「流形优化 × 大模型」的里程碑式结合

🔥 2. WSqD:无需预设训练步数的学习率调度器(2607.10959)

维度 详情
论文 2607.10959
提交 2026年7月12日
作者 Jianhao Ma, Yuxin Chen
核心 现有调度器(cosine、WSD)的峰值 LR 都依赖于预设的训练步数。WSqD 将 stable 阶段替换为 shifted inverse-square-root base,证明在随机凸优化下达到最优 $O(1/\sqrt{T})$ 末轮收敛率,且基础 LR 与训练步数完全解耦
效果 SlimPajama 上的语言模型预训练中,WSqD 匹配或超越精心调参的 WSD,且同一峰值 LR 可跨不同训练步数复用
意义 如果 WSqD 在大规模上验证有效,将大幅减少 LR 调度调参成本

📊 大模型优化器(仅限新内容)

🟢 LionVote:逐层学习率自适应——Lion 优化器的精细化调参(2607.09266)

维度 详情    
论文 2607.09266 提交 7月10日
作者 Kris Atallah(单人)    
核心 诊断发现 Lion 默认 LR 对 ViT-Tiny 的 Attention/MLP 层偏高 2.6-2.8×,对归一化层偏高 ~2×。LionVote 为每层参数张量维护一个整数「compound level」,每 c 轮用两个诊断指标(梯度方向稳定性和动量健康度)投票决定增减    
效果 ViT-Tiny/CIFAR-100 上 LionVote 69.7% vs Lion 69.0% vs AdamW 68.8%(p<0.02)    
意义 首个为 Lion 设计的系统化逐层 LR 机制。但增益依赖架构异质性,在均匀 CNN 上无优势    

🟢 LR Cooldown 何时有效?——噪声结构与优化器归一化的联合作用(2607.12360)

维度 详情    
论文 2607.12360 提交 7月14日
作者 Subham Singh, Ashutosh Mishra, Subha Raut    
核心 WSD 调度器的 cooldown 阶段在某些场景下降低 loss,在其他场景下毫无效果。本文给出可证明解释:关键取决于梯度噪声结构优化器是否归一化更新。SGD 在乘法噪声(与梯度成比例的噪声)下自身会收缩步长,cooldown 无帮助;归一化方法(signSGD 等)保持单位步长,需要 cooldown 来消除噪声底限    
意义 为大规模预训练中「cooldown 是否必要」提供了理论判据    

🟢 Schedule-Free 方法的非凸优化理论(2607.09167)

维度 详情    
论文 2607.09167 提交 7月10日
作者 Jiseok Chae, Donghwan Kim    
核心 对 Schedule-Free GD 和 Schedule-Free SGD 提供非凸优化下的最坏情况收敛分析,证明其逃逸鞍点的能力与标准 SGD + 余弦退火相当    
意义 填补了 Schedule-Free 方法的非凸收敛理论空白    

🟢 The Silent Freeze:低精度训练「静默冻结」预测(2607.09800)

维度 详情    
论文 2607.09800 提交 7月9日(前次窗口遗漏,首次覆盖)
作者 Zekai Shang(单人)    
核心 低精度训练中,当梯度更新 < 权重 ULP 的一半时,该坐标「冻结」——梯度非零但不生效。该效应可预测:仅需高精度轨迹和目标尾数长度即可预判哪些坐标何时冻结。在小 GPT 上用 AdamW+FP8 分析,发现嵌入层和高 LR 层最先冻结    
意义 对 FP4/FP8 低精度训练的质量保证有实用价值    

🟢 How to Tame Grokking:表征几何作为控制信号(2607.11666)

维度 详情    
论文 2607.11666 提交 7月13日
作者 Maksim A Kazanskii(单人)    
核心 发现维度坍塌一致地先于 grokking(延迟泛化)出现。基于此提出用表示几何作为控制信号来加速泛化出现    
意义 几何视角解释 grokking 现象    

🟢 方向汇总

方向 状态
LR 调度理论 密集涌现——WSqD(horizon-free)、Cooldown 理论、Schedule-Free 非凸理论、LionVote(逐层 LR)同期出现,LR 调度进入「精细化/理论化」阶段
低精度训练 The Silent Freeze 诊断低精度训练的退化模式
Muon/SOAP 家族 本期无新增 Muon/SOAP/Shampoo 论文
AdamW 改进 本期无新增
训练动态理论 Grokking 的几何解释 + Schedule-Free 收敛性

🔄 流形优化(仅限新内容)

🟢 Cobras:黎曼最优传输用于 LLM 激活控制——流形方法进入 LLM 推理(2607.10517)

维度 详情    
论文 2607.10517 提交 7月12日
作者 Seyed Arshan Dalili 等(宾夕法尼亚州立大学)    
核心 现有激活控制方法启发式优化密度比目标,且产生查询无关的控制方向。Cobras 将激活控制建模为残差流超球面上的 Schrödinger Bridge 问题——用熵正则化最优传输求解,得到的控制方向是查询自适应的。证明熵传输解退化为传统密度比梯度    
效果 在 helpfulness、truthfulness、detoxification 三个对齐轴上的 4 个模型上一致超越现有基线,避免 OOD 退化    
意义 流形优化 + LLM 推理控制的优雅结合——黎曼几何 + 最优传输 + LLM 对齐,方法本身就有理论美感    

🟢 Sparse Stiefel 流形上的 Newton 加速(2607.12877)

维度 详情    
论文 2607.12877 提交 7月14日
作者 Shixiang Chen, Wen Huang    
核心 稀疏 Stiefel 流形优化的主要困难:非光滑正则化子识别的活跃流形可能与 Stiefel 流形非横截相交,阻碍黎曼 Newton 步。本文提出 MIX 方法:(1) 横向时证明 ManPG 切近邻投影的局部识别性;(2) 非横向时引入「对角扰动 Stiefel 族」恢复识别几何;(3) 在压缩模态和稀疏 PCA 实验上验证加速    
意义 为流形上的稀疏优化提供超线性收敛保证    

🟢 仿射不变黎曼几何中的结构化预条件(2607.12286)

维度 详情    
论文 2607.12286 提交 7月14日
作者 Zavier Li(与上期 Optimization Geometrodynamics 同作者)    
核心 研究 Kronecker 正定矩阵在仿射不变黎曼度量下的最近结构化逼近与最佳结构化预条件之间的关系。证明 Kronecker 族是闭的且测地凸,其投影唯一并满足条件最优性的充要条件。建立了极谱状态与张量边缘的可计算不匹配判据    
意义 这是 Zavier Li 继 Optimization Geometrodynamics 后第二篇几何优化理论工作——该系列正在构建完整的几何优化语言体系    

🟢 仿射横向 Hilbert 子流形优化:理论基础(2607.10861)

维度 详情    
论文 2607.10861 提交 7月12日
作者 Yongcun Song 等(香港大学)    
核心 为非线性流形与仿射子空间交集的优化问题建立理论基础:切空间刻画、投影算子、隐式回缩算子,确保算法设计中迭代的可行性    
意义 补全了约束优化中「非线性 + 线性约束交集」的几何理论工具箱    

🟢 黎曼多层次优化(2607.09517)

维度 详情    
论文 2607.09517 提交 7月10日
作者 Yara Elshiaty 等    
核心 将多层次优化方法扩展到黎曼流形约束的能量最小化问题,引入一阶相干的粗模型和度量兼容的向量传输算子    
意义 数字几何处理和科学计算领域的重要扩展    

🟢 方向汇总

方向 状态
流形优化 × LLM 重大突破! RIPO(训练时策略优化)+ Cobras(推理时激活控制)两篇工作同时将黎曼几何引入 LLM 流程,且都是首个在各自场景中揭示欧氏度量缺陷并提出黎曼几何修正的工作
流形优化基础理论 Stiefel 流形 Newton 加速 + 仿射横向 Hilbert 子流形 + 仿射不变预条件理论同期充实
流形优化 × 科学计算 黎曼多层次优化 + Stiefel 稀疏 PCA
核心趋势 Zavier Li 的两篇连续工作正在建立几何优化的统一语言体系

本期最重要的趋势信号是「黎曼几何正式进入 LLM 优化」——RIPO 和 Cobras 分别从 LLM 训练和推理两个方向展示了欧氏度量的局限性,并用黎曼几何提出优雅修正。建议跨期追踪这两篇工作的社区反响。


💡 讨论与趋势

1. 「黎曼几何 + LLM」组合突然涌现

本期最令人兴奋的趋势不是单一方向的深化,而是两个方向首次实质性交叉

工作 场景 欧氏缺陷 黎曼修正 增益
RIPO (2607.10169) LLM RL 训练 PPO-Clip 使用欧氏度量导致探索崩溃 黎曼等距策略更新 AIME24 提升 60%
Cobras (2607.10517) LLM 推理控制 查询无关且 OOD 退化 超球面 Schrödinger Bridge 三轴对齐超越基线

这说明流形优化这个相对「学院派」的方向正在找到切实的 LLM 应用场景

2. LR 调度进入「去 horizon 依赖」时代

WSqD、Cooldown 理论、Schedule-Free 非凸收敛性三篇独立工作从不同角度逼近同一个目标:让大规模训练不再需要反复调整 LR 调度方案。如果 WSqD 在大规模上验证成功,它可能是比新的优化器设计更实用的贡献。

3. LionVote 的启示:优化器「一层一参数」

LionVote 的单人作者以简洁的诊断发现:即使是同一优化器、同一张图,不同层的最优 LR 可以差 2.8 倍。这支持了「逐层优化器配置」(如 SOAP 的逐层预条件、AngleMuown 的逐层角度控制)的趋势合理性。

4. 下期关注

  1. RIPO 是否会在 LLM RL 社区引发跟进(Poincaré 度量?双曲 RL?)
  2. WSqD 在 ≥7B 模型上的验证结果
  3. Cobras 的 Schrödinger Bridge 框架是否可扩展到 RLHF
  4. Structured Preconditioning 与 Shampoo/SOAP 的 Kronecker 因式分解关系
  5. 7月16日前后 arXiv 新提交(周三/周四是密集窗口)