大模型优化器 & 流形优化日报 — 2026年6月13日
大模型优化器 & 流形优化日报 — 2026年6月13日
🔬 大模型优化器 & 流形优化日报
覆盖日期:2026年6月10日 – 6月13日 上期成功报告:2026年6月10日 本期执行:2026年6月13日 08:00
📌 本期重点
🔥 1. LoRA-Muon:低秩流形上的谱最陡下降(2606.12921)
| 维度 | 详情 |
|---|---|
| 论文 | 2606.12921 — Franz Louis Cesista, Katherine Crowson, Cédric Simal, Stella Biderman(EleutherAI) |
| 提交 | 2026年6月11日 |
| 核心 | 将 Muon 的谱最陡下降规则(极分解更新)应用到低秩适应(LoRA) 场景,推导出 LoRA-Muon |
| 关键发现 | LoRA-Muon 是全秩 Muon 和 Shampoo 族优化器的良好低秩代理——最优学习率在 rank/width/depth/因子缩放间可迁移 |
| 实证 | TinyShakespeare 上 rank-2 恢复密集最优学习率;rank-32 平均验证损失低于密集基线 |
| 内存优势 | 无需 QR 分解,不存储二阶矩,比 Spectron/LoRA-RITE 更加速器友好 |
| Split WD | 提出分裂权重衰减规则,解决低秩优化中的 LR 迁移难题 |
意义:LoRA-Muon 填补了「Muon 族优化器在低秩微调场景」的空白。此前 LoRA 使用 AdamW 时存在初始化敏感、LR 跨秩迁移差、难超密集基线三大问题。LoRA-Muon 一举解决三者。Katherine Crowson(stable-diffusion 社区核心作者)和 Stella Biderman(EleutherAI 创始人)的联合署名也增加了该工作的可信度。
🔥 2. 不同层需要不同流形——Transformer 模块感知流形分配(2606.13276)
| 维度 | 详情 |
|---|---|
| 论文 | 2606.13276 — Kirato Yoshihara |
| 提交 | 2026年6月11日 |
| 核心发现 | Transformer 不同模块偏好不同的流形几何:Attention 层用 Stiefel 流形,MLP 层用 DGram 流形 |
| 最佳配置 | Attention=Stiefel + MLP=DGram 混合配置显著优于均匀约束 |
| 失败模式 | 翻转分配(Attention=DGram + MLP=Stiefel)和全 DGram 在共享超参数下不稳定 |
| 原因追溯 | DGram 约束下 Attention 权重的奇异值增长→放大 Attention logits→Softmax 饱和 |
| 结论 | 对称感知和几何感知优化应模块特异性而非均匀施加 |
意义:与上期「架构-优化器协同设计」趋势完全一致。上期 PC Layer、Parallax 从架构内置谱优化角度出发;本期从流形选择角度揭示「不同模块需要不同几何约束」——这直接指向了下一代优化器的设计方向:层感知的混合流形优化。
📊 大模型优化器(仅限前几期未覆盖的新内容)
🟢 FOGO:遗忘感知正交化优化器(2606.10406)
| 维度 | 详情 |
|---|---|
| 提交 | 2026年6月9日 |
| 作者 | Toan Nguyen, Yang Liu, Trung Le 等 |
| 核心洞察 | 遗忘不仅是持续学习的现象——标准训练中,主导小批量梯度也会抑制稀有但有用的更新方向,每步都在发生短期遗忘 |
| 方法 | FOGO 持续检测并解决梯度干扰:频谱正交化动量更新→紧凑码本记忆存储代表过去方向→轻量正交校正解决冲突→近端步骤回升 |
| 实证 | 在类别不平衡分类、持续学习、LLaVA-7B 持续微调、GPT-2 预训练上一致优于 Adam 和 Muon |
| 代码 | 未发现公开仓库 |
意义:FOGO 提出了一个独特视角——遗忘是通用优化现象,不仅限于持续学习。它将正交化技术用于「防止有用方向被淹没」而非仅「加速收敛」,是 Muon 思想在另一维度的推广。
🟢 AMUSE:Anytime Muon + 稳定梯度评估(2605.22432)
| 维度 | 详情 |
|---|---|
| 提交 | 2026年5月21日 — 此前未覆盖 |
| 作者 | Chulhee Yun(KAIST)团队 |
| 核心 | Muon 通过「河谷」损失景观:快收敛沿河床(平坦低曲率 bulk 子空间),但正交化同时放大了主导方向噪声引起振荡 |
| AMUSE | 时变插值系数:初始评估近期 Muon 序列的梯度快速适应 → 逐渐切换至稳定平均序列抑制振荡 |
| 优势 | 无需学习率调度,支持任意时刻(anytime)训练 |
| 实证 | 在视觉任务和 LLM 预训练中,AMUSE 在性能-迭代 Pareto 前沿上一致优于(Schedule-Free)AdamW 和 Muon |
意义:AMUSE 是 Muon 与 Schedule-Free 思想的首次系统结合。Chulhee Yun 组此前从最优传输角度分析过 Muon,这次从损失景观动力学出发给出了「为什么 Muon + 迭代平均能更好」的理论解释。
🟢 SoSD:奇异分布稳定性——预测练双阶段动力学的谱视角(2605.26489)
| 维度 | 详情 |
|---|---|
| 提交 | 2026年5月26日 — 此前未覆盖 |
| 作者 | Hongtao Zhang, Wenjie Zhou 等(中科院) |
| 核心发现 | LLM 预训练中奇异值谱在早期便已稳定(SoSD),即使参数矩阵继续演化 |
| 广泛性 | SoSD 同步于缓慢下降阶段,在 GPT-2 / LLaMA、Step-wise / WSD / Cosine、不同权重衰减、AdamW / Muon 下普遍存在 |
| 理论证明 | 简化 Transformer 中证明权重范数增长必然触发 SoSD 阈值,之后损失下降率被奇异值分布变化约束 |
| 解释力 | WSD 调度和 Muon 优化器的工作机制可解释为对 SoSD 尺度的调制 |
意义:SoSD 为「为什么预训练呈现两阶段(快速下降→缓慢改进)?」提供了统一的谱视角。该工作与中国团队 5 月的工作(2605.22297 Heavy-Tail Guided Layerwise LR)同源,都来自对权重谱结构的深入研究。
🟢 随机更新偏置校正:AdamW/Sophia/Shampoo 均可受益(2605.20756)
| 维度 | 详情 |
|---|---|
| 提交 | 2026年5月20日 — 此前未覆盖 |
| 核心 | 预条件优化器存在两个有限样本偏置:(1) 梯度和预条件估计来自同一 minibatch→耦合偏置;(2) 预条件估计无偏但其逆/逆根非线性导致有偏 |
| 方法 | 交叉拟合预条件 + 方差校正逆运算 |
| 效果 | Qwen2.5-0.5B 上偏置校正降低预训练损失 0.11-0.15 nats,对 AdamW/Sophia/Shampoo 均有效 |
| 下游影响 | 对混合质量预训练和指令微调一致为中等到正面 |
意义:该工作揭示了预条件优化器一个被普遍忽视的偏置源。虽然每篇论文都假设「随机版本近似于全批量版本」,但实际并非如此。这个偏置校正框架对所有主流预条件优化器(AdamW、Sophia、Shampoo)都能提供独立增益。
📊 本期新论文一览(均未在6/7和6/10期报道)
| 论文 | ID | 日期 | 方向 | 核心贡献 |
|---|---|---|---|---|
| LoRA-Muon ★ | 2606.12921 | 6/11 | 低秩流形优化 | Muon 到 LoRA 的迁移,LR 跨秩可迁移,rank-32 超密集基线 |
| 模块感知流形 ★ | 2606.13276 | 6/11 | 层感知流形分配 | Attention=Stiefel + MLP=DGram 最优 |
| FOGO | 2606.10406 | 6/9 | 遗忘感知优化 | 正交化解决梯度干扰,超越 Muon |
| AMUSE | 2605.22432 | 5/21 | Muon+调度自由 | 河谷景观理论+时变插值,无需 LR 调度 |
| SoSD | 2605.26489 | 5/26 | 谱动力学理论 | 预训练双阶段谱统一解释 |
| 偏置校正 | 2605.20756 | 5/20 | 预条件优化理论 | 通用偏置校正:AdamW/Sophia/Shampoo 均受益 |
| Riemannian MMS | 2605.27779 | 5/26 | 几何收敛理论 | Riemannian 梯度流的全局收敛性 |
本期关键词:6月11日 arXiv 迎来新一轮「论文波」——LoRA-Muon 和模块感知流形是本期最值得关注的两篇新工作,分别从低秩优化和层特异性流形两个方向推进了 Muon × 流形的交叉前沿。
🔄 流形优化(仅限前几期未覆盖的新内容)
🟢 Riemannian 梯度流的全局收敛理论(2605.27779)
| 维度 | 详情 |
|---|---|
| 提交 | 2026年5月26日 — 此前未覆盖 |
| 作者 | Shixin Zheng, Yiwei Wang, Haizhao Yang |
| 核心框架 | 在最小化移动方案(MMS)框架内建立神经网络的几何收敛理论 |
| 关键证明 | 每个 MMS 步的增量集合构成边界光滑嵌入子流形 → 参数空间中的预条件(Gauss-Newton 型)梯度流等价于 Riemannian 梯度流 |
| 收敛性 | 在测地凸性和强凸性条件下,连续 Riemannian 梯度流和离散指数映射变体线性收敛到唯一子问题极小点 |
| 误差传播 | 传播内求解器不精确性和神经网络近似误差→统一函数空间追踪界→不精确迭代收敛到全局最小的 O(δ)邻域 |
| 数值实验 | Gauss-Newton 型内求解器在非线性回归和潜扩散小测试集上更少的内部迭代实现更小的轨迹误差 |
意义:该工作提供了最严格的 Riemannian 优化与深度学习结合的理论框架之一。它将神经网络训练重新理解为 Riemannian 流形上的梯度流,并给出完整的误差传播界——不同于 iMuon 等具体优化器实现,这是纯粹的收敛理论。
📊 流形优化其他方向
| 方向 | 状态 |
|---|---|
| 几何深度学习 | 本期无新增重要突破 |
| 流形 × LLM 交叉 | LoRA-Muon(2606.12921) 和 模块感知流形(2606.13276) 是本期最直接的两篇交叉工作——均已在上方重点报道 |
| Riemannian 优化理论 | Riemannian MMS(2605.27779)是本期唯一纯理论贡献 |
| iMuon(2605.09238) | 仍是「流形×Muon×LLM」最完整的工作,本期无社区复现更新 |
流形优化本期迎来两篇重要的交叉论文(LoRA-Muon 和模块感知流形),标志着流形几何思想正在渗透到优化器的工程实现层面——从纯理论走向了可落地的优化器变体。
💡 讨论与趋势
1. 「6月11日论文波」——ICML 2026 接收前后的新提交潮
上期预期「6月中旬 ICML 2026 接收通知前后可能有新论文 wave」,果然在6月11日出现了密集提交:
- LoRA-Muon(EleutherAI + Crowson)和 模块感知流形 两篇同一天提交
- 加上 FOGO(6月9日),总计至少3篇全新优化器论文在本窗口涌现
- 方向集中在:低秩场景的优化器适配和流形约束的层特异性分配
这不仅验证了上期的预测,也表明 Muon 研究的重心正在从「理解为什么好」转向「如何在现实场景中用好」。
2. 低秩微调优化器形成新热点
| 工作 | 方法 | 核心优势 |
|---|---|---|
| LoRA-Muon(本期) | 谱最陡下降→低秩流形 | LR 跨秩迁移、超密集基线 |
| iMuon(上期) | Riemannian 流形×Muon | 最完整的流形×LLM 理论 |
| Spectron(5月) | QR 坐标更新 | 但被 LoRA-Muon 指出因子缩放依赖问题 |
| LoRA-RITE(5月) | 简化 QR 坐标 | 与 LoRA-Muon 核心更新等价 |
LoRA-Muon 明确指出了 Spectron 的因子缩放依赖问题,表明低秩优化器设计正在经历一次「清理」——从多个独立提案走向统一理解和比较。
3. SoSD:来自中国团队的谱分析
中科院团队的 SoSD 工作与大模型训练实践高度相关:解释了 WSD 调度和 Muon 为何有效——它们都在调节奇异值分布的稳定尺度。这也与上期 Spectral Scaling Laws(MIT 团队)形成跨团队的谱分析共鸣,表明谱动力学正在成为理解预训练优化的核心视角。
4. 下期关注
- LoRA-Muon 开源实现和社区复现(期待 EleutherAI 发布代码)
- 模块感知流形 是否被推广到更大的 LLaMA 规模
- FOGO 的 GitHub 仓库是否发布
- AMUSE 是否被纳入主流 LLM 训练框架
- ICML 2026 正式接收论文列表(预计6月中旬公布)——可能包含大量优化器论文
- 中国团队(中科院 SoSD、华为 OneLR、浙大等)的后续优化器工作
📋 数据来源
| 来源 | 检索方式 | 获取新论文数 |
|---|---|---|
| arXiv cs.LG (Muon/optimizer/AdamW) | API 搜索 | 7 篇未报道 |
| arXiv (Riemannian/manifold) | API 搜索 | 1 篇未报道 |
| GitHub 仓库搜索 | API | 未发现重大新仓库 |
| 交叉验证 | 与上两期日报对比(6/7 + 6/10) | 排除所有已报道 |
下期预告:下次执行 2026-06-16。重点关注:ICML 2026 接收论文列表、LoRA-Muon 开源进展、模块感知流形的大规模验证、6月第三周新提交。