大模型优化器 & 流形优化日报 — 2026年4月28日

大模型优化器 & 流形优化日报 — 2026年4月28日

大模型优化器 & 流形优化日报

日期:2026年4月28日(周二)
覆盖时段:4月24日—4月27日(周末无新提交)


📌 今日重点

🔥 1. SOAP 优化器首次收敛性证明(2604.21616)

本周最重磅的理论进展:SOAP 优化器的首次收敛率分析出炉。论文将分析扩展到允许任意正交投影矩阵的广义 SOAP 变体,仅要求这些矩阵与当前随机梯度条件独立。

重要性:SOAP 是 DeepSeek、Kimi 等头部团队在用的矩阵型优化器,此前只有经验性性能报告,缺乏理论保证。这个收敛性证明填补了关键空白。

  • 📄 arXiv: https://arxiv.org/abs/2604.21616

🔥 2. Muon 生态持续爆发

GitHub 上出现多个独立的 Muon 优化器实现: - CUDA 加速版(Newton-Schulz 极分解,cuBLAS 加速,A100 实测 8× FLOP 节省):muon_exps - LoRA + Muon 对比研究:AdamW vs Muon vs MeZO:LLM_Training_Acceleration - 端到端 LLM 训练(BPE Tokenizer + Muon + Cosine LR):llm-training

趋势明确:Muon 正在从「论文里的优化器」变成「工程上可用的优化器」。


📊 大模型优化器

新论文

论文 日期 要点
SOAP Convergence Rate Analysis 4/24 首次证明 SOAP 收敛率,支持任意正交投影矩阵,仅需条件独立性假设
Self-Abstraction Learning 4/27 提出自抽象学习方法实现深度网络稳定训练
Fast Adversarial Training Error Mitigation 4/27 缓解快速对抗训练中的误差放大问题
Split Learning for LLM Fine-Tuning Survey 4/27 综述 split learning 在 LLM 微调中的应用,覆盖模型/系统/隐私三个维度

工具 & 社区

  • Muon CUDA 实现(HyperKuvid-Labs):面向 Llama 3.1 8B 架构优化,A100 实测。Newton-Schulz 迭代 + cuBLAS + 转置优化,声称 FFN 层 8× FLOP 节省。
  • Muon+LoRA 对比基准(Anthonio-Verdeggiante):系统对比 AdamW / Muon / MeZO 三种优化策略在 LoRA 微调下的表现。
  • LLM from Scratch(objones25):完整开源项目展示用 Muon 从头训练 GPT 风格 LLM。

趋势判断

二阶优化器(SOAP/Shampoo)的理论追赶实践进程加速。Muon 的工程化落地速度超出预期,多个独立团队在复现和优化。MeZO 等内存高效方法也开始与主流优化器进行系统对比。


🔄 流形优化

新论文

论文 日期 要点
Shape of Memory 4/24 🏆 今日最佳流形方向论文。从几何角度分析二阶优化器中机器遗忘(machine unlearning)的行为。比较一阶/二阶方法在数据删除任务上的表现,发现两者在性能和梯度上都能重新对齐理想情况,但二阶方法的「记忆形状」几何特性更丰富
FedSPDnet 4/24 将 SPD 流形几何引入联邦学习。提出 ProjAvg(投影到 Stiefel 流形)和 RLAvg 两种聚合策略,解决传统欧氏平均破坏正交性约束的问题
MADE-IT 4/24 流形感知的自适应模型合并框架(参见昨日日报)
GeoEdit 4/27 在数据流形切空间上估计局部坐标系,实现扩散模型的快速、免训练 on-manifold 编辑。通过局部更新替代完整去噪路径,大幅降低迭代成本
Certified Geometric Robustness (Super-DeepG) 4/27 几何鲁棒性认证的新框架

趋势判断

流形优化正在从理论工具走向实际应用: 1. 机器遗忘(Shape of Memory)—— 用几何方法理解模型记忆,这是 GDPR/隐私合规的刚需方向 2. 联邦学习(FedSPDnet)—— SPD 流形不再只是理论玩具,进入分布式训练场景 3. 扩散模型(GeoEdit)—— 流形上的局部编辑成为扩散模型高效推理的新范式


💡 讨论 & 观点

优化器格局演变

当前 LLM 训练优化器格局正在分化成三条路线:

  1. AdamW 改进派:SOAP/Shampoo,在 AdamW 框架内引入二阶信息,理论渐趋完备
  2. 新范式派:Muon,完全不同的更新规则(Newton-Schulz 极分解),工程落地加速
  3. 效率派:MeZO/Lion/内存高效方法,零阶优化 + 符号梯度

三者的交叉对比(如 Muon vs MeZO vs AdamW 的 LoRA 实验)将成为今年下半年的重要研究方向。

流形优化的「实用化」拐点

本周的论文清晰地展示了一个趋势:流形/几何优化正在走出纯数学圈子。Shape of Memory 连接了几何优化与隐私合规,FedSPDnet 连接了几何与分布式训练,GeoEdit 连接了几何与生成模型。这种「跨领域穿透」是技术成熟的标志。


📎 来源汇总

来源 类型 链接
SOAP 收敛性证明 论文 https://arxiv.org/abs/2604.21616
Shape of Memory 论文 https://arxiv.org/abs/2604.23046
FedSPDnet 论文 https://arxiv.org/abs/2604.22494
MADE-IT 论文 https://arxiv.org/abs/2604.22464
GeoEdit 论文 https://arxiv.org/abs/2604.24238
Super-DeepG 论文 https://arxiv.org/abs/2604.24379
Split Learning Survey 论文 https://arxiv.org/abs/2604.24468
Self-Abstraction Learning 论文 https://arxiv.org/abs/2604.24313
Fast Adversarial Training 论文 https://arxiv.org/abs/2604.24332
Muon CUDA (HyperKuvid) GitHub https://github.com/HyperKuvid-Labs/muon_exps
Muon+LoRA 对比 GitHub https://github.com/Anthonio-Verdeggiante/LLM_Training_Acceleration
LLM+Muon Training GitHub https://github.com/objones25/llm-training

昨日日报2026-04-27 日报 — 覆盖 SOAP 收敛证明首次曝光、MADE-IT 流形模型合并、Muon 生态爆发初现
参见此前报告:Seurat v5.5.0 深度解析