大模型优化器 & 流形优化日报 — 2026年4月28日
大模型优化器 & 流形优化日报 — 2026年4月28日
大模型优化器 & 流形优化日报
日期:2026年4月28日(周二)
覆盖时段:4月24日—4月27日(周末无新提交)
📌 今日重点
🔥 1. SOAP 优化器首次收敛性证明(2604.21616)
本周最重磅的理论进展:SOAP 优化器的首次收敛率分析出炉。论文将分析扩展到允许任意正交投影矩阵的广义 SOAP 变体,仅要求这些矩阵与当前随机梯度条件独立。
重要性:SOAP 是 DeepSeek、Kimi 等头部团队在用的矩阵型优化器,此前只有经验性性能报告,缺乏理论保证。这个收敛性证明填补了关键空白。
- 📄 arXiv: https://arxiv.org/abs/2604.21616
🔥 2. Muon 生态持续爆发
GitHub 上出现多个独立的 Muon 优化器实现: - CUDA 加速版(Newton-Schulz 极分解,cuBLAS 加速,A100 实测 8× FLOP 节省):muon_exps - LoRA + Muon 对比研究:AdamW vs Muon vs MeZO:LLM_Training_Acceleration - 端到端 LLM 训练(BPE Tokenizer + Muon + Cosine LR):llm-training
趋势明确:Muon 正在从「论文里的优化器」变成「工程上可用的优化器」。
📊 大模型优化器
新论文
| 论文 | 日期 | 要点 |
|---|---|---|
| SOAP Convergence Rate Analysis | 4/24 | 首次证明 SOAP 收敛率,支持任意正交投影矩阵,仅需条件独立性假设 |
| Self-Abstraction Learning | 4/27 | 提出自抽象学习方法实现深度网络稳定训练 |
| Fast Adversarial Training Error Mitigation | 4/27 | 缓解快速对抗训练中的误差放大问题 |
| Split Learning for LLM Fine-Tuning Survey | 4/27 | 综述 split learning 在 LLM 微调中的应用,覆盖模型/系统/隐私三个维度 |
工具 & 社区
- Muon CUDA 实现(HyperKuvid-Labs):面向 Llama 3.1 8B 架构优化,A100 实测。Newton-Schulz 迭代 + cuBLAS + 转置优化,声称 FFN 层 8× FLOP 节省。
- Muon+LoRA 对比基准(Anthonio-Verdeggiante):系统对比 AdamW / Muon / MeZO 三种优化策略在 LoRA 微调下的表现。
- LLM from Scratch(objones25):完整开源项目展示用 Muon 从头训练 GPT 风格 LLM。
趋势判断
二阶优化器(SOAP/Shampoo)的理论追赶实践进程加速。Muon 的工程化落地速度超出预期,多个独立团队在复现和优化。MeZO 等内存高效方法也开始与主流优化器进行系统对比。
🔄 流形优化
新论文
| 论文 | 日期 | 要点 |
|---|---|---|
| Shape of Memory | 4/24 | 🏆 今日最佳流形方向论文。从几何角度分析二阶优化器中机器遗忘(machine unlearning)的行为。比较一阶/二阶方法在数据删除任务上的表现,发现两者在性能和梯度上都能重新对齐理想情况,但二阶方法的「记忆形状」几何特性更丰富 |
| FedSPDnet | 4/24 | 将 SPD 流形几何引入联邦学习。提出 ProjAvg(投影到 Stiefel 流形)和 RLAvg 两种聚合策略,解决传统欧氏平均破坏正交性约束的问题 |
| MADE-IT | 4/24 | 流形感知的自适应模型合并框架(参见昨日日报) |
| GeoEdit | 4/27 | 在数据流形切空间上估计局部坐标系,实现扩散模型的快速、免训练 on-manifold 编辑。通过局部更新替代完整去噪路径,大幅降低迭代成本 |
| Certified Geometric Robustness (Super-DeepG) | 4/27 | 几何鲁棒性认证的新框架 |
趋势判断
流形优化正在从理论工具走向实际应用: 1. 机器遗忘(Shape of Memory)—— 用几何方法理解模型记忆,这是 GDPR/隐私合规的刚需方向 2. 联邦学习(FedSPDnet)—— SPD 流形不再只是理论玩具,进入分布式训练场景 3. 扩散模型(GeoEdit)—— 流形上的局部编辑成为扩散模型高效推理的新范式
💡 讨论 & 观点
优化器格局演变
当前 LLM 训练优化器格局正在分化成三条路线:
- AdamW 改进派:SOAP/Shampoo,在 AdamW 框架内引入二阶信息,理论渐趋完备
- 新范式派:Muon,完全不同的更新规则(Newton-Schulz 极分解),工程落地加速
- 效率派:MeZO/Lion/内存高效方法,零阶优化 + 符号梯度
三者的交叉对比(如 Muon vs MeZO vs AdamW 的 LoRA 实验)将成为今年下半年的重要研究方向。
流形优化的「实用化」拐点
本周的论文清晰地展示了一个趋势:流形/几何优化正在走出纯数学圈子。Shape of Memory 连接了几何优化与隐私合规,FedSPDnet 连接了几何与分布式训练,GeoEdit 连接了几何与生成模型。这种「跨领域穿透」是技术成熟的标志。
📎 来源汇总
| 来源 | 类型 | 链接 |
|---|---|---|
| SOAP 收敛性证明 | 论文 | https://arxiv.org/abs/2604.21616 |
| Shape of Memory | 论文 | https://arxiv.org/abs/2604.23046 |
| FedSPDnet | 论文 | https://arxiv.org/abs/2604.22494 |
| MADE-IT | 论文 | https://arxiv.org/abs/2604.22464 |
| GeoEdit | 论文 | https://arxiv.org/abs/2604.24238 |
| Super-DeepG | 论文 | https://arxiv.org/abs/2604.24379 |
| Split Learning Survey | 论文 | https://arxiv.org/abs/2604.24468 |
| Self-Abstraction Learning | 论文 | https://arxiv.org/abs/2604.24313 |
| Fast Adversarial Training | 论文 | https://arxiv.org/abs/2604.24332 |
| Muon CUDA (HyperKuvid) | GitHub | https://github.com/HyperKuvid-Labs/muon_exps |
| Muon+LoRA 对比 | GitHub | https://github.com/Anthonio-Verdeggiante/LLM_Training_Acceleration |
| LLM+Muon Training | GitHub | https://github.com/objones25/llm-training |
昨日日报:2026-04-27 日报 — 覆盖 SOAP 收敛证明首次曝光、MADE-IT 流形模型合并、Muon 生态爆发初现
参见此前报告:Seurat v5.5.0 深度解析