浙大团队23种优化器评测总结 — 2026年6月3日
浙大团队23种优化器评测总结 — 2026年6月3日
浙大团队23种优化器评测总结
来源:36氪报道《Adam之后选哪个?浙大团队对23种优化器做了迄今最系统的评测》
核心结论
- AdamW综合最佳:在大多数场景下表现最稳定
- 没有万能冠军:不同网络结构/任务有各自适配的优化器
- Lion性价比突出:Google提出的Lion在参数量更少的情况下达到接近AdamW的效果
6大类23种优化器分类总结
🅰 经典动量派
| 优化器 | 核心思想 |
|---|---|
| SGD | 最原始的随机梯度下降,按batch计算梯度更新参数 |
| SGD + Momentum | 引入动量项,累积历史梯度方向,加速收敛、抑制震荡 |
| Nesterov (NAG) | “前瞻”式动量——先按动量方向预估下一步位置,再在该位置计算梯度 |
特点:实现简单、泛化性好;但收敛慢、需要精细调LR。
🅱 自适应学习率派
| 优化器 | 核心思想 |
|---|---|
| AdaGrad | 每个参数独立LR,用历史梯度平方和做分母——稀疏特征更新大、频繁特征更新小 |
| RMSProp | 用指数移动平均代替AdaGrad的累加和,解决LR单调递减到零的问题 |
| Adam | RMSProp + Momentum:一阶矩(动量)+ 二阶矩(自适应LR) |
| AdamW | Adam + 解耦权重衰减——正确实现L2正则化,修正了Adam中权重衰减与自适应LR的耦合 |
特点:自适应LR,调参省心;但泛化性有时不如SGD/动量。
🅲 Adam改进派
| 优化器 | 核心思想 |
|---|---|
| RAdam | 用整流项修正Adam早期的方差过大问题——前几步不信任动量估计 |
| NAdam | Adam + Nesterov动量——结合两派优势 |
| AdaBelief | 根据”相信当前梯度”的程度调整步长——梯度与预测一致时大步,分歧时小步 |
| AMSGrad | 保证二阶矩估计不递减——解决Adam在某些场景下不收敛的理论缺陷 |
特点:试图修复Adam的已知缺陷,各有偏重。
🅳 符号/阈值派
| 优化器 | 核心思想 |
|---|---|
| SignSGD | 只保留梯度符号(+1/-1),大幅降低通信开销 |
| LARS | 逐层LR缩放——根据权重范数与梯度范数的比值调整每层的学习率 |
| LAMB | LARS的改进版,引入Adam的二阶矩估计——适合大batch训练 |
| Nero | 近端归一化梯度——强制每层输出归一化后再更新 |
特点:关注通信效率和大batch训练场景。
🅴 二阶方法派
| 优化器 | 核心思想 |
|---|---|
| KFAC | Kronecker因子近似曲率——用Kronecker积分解近似Fisher信息矩阵 |
| Shampoo | 预条件矩阵的4阶张量推广——KFAC的泛化形式 |
| SOAP | Shampoo的简化版——在子空间上做预条件,降低Shampoo的计算开销 |
特点:理论上最强(利用曲率信息),但计算开销大。
🅵 前沿新范式派
| 优化器 | 核心思想 |
|---|---|
| Lion | 符号操作 + 动量——用符号函数做更新,无需二阶矩估计,内存省一半 |
| Muon | 正交化梯度更新——在矩阵层面做正交化/谱白化 |
| Sophia | 用Hessian对角估计做步长缩放——二阶信息但只需一次额外前向 |
| C-Adam | 基于”line of sight”方法的新型Adam变体 |
特点:2024-2026年的新工作,代表了优化器设计的前沿方向。
总结
浙大团队的评测表明:AdamW是当前最稳健的默认选择,但在特定场景下(如大batch、低精度、低内存)其他优化器可能有更好表现。优化器的选择本质上是对收敛速度、泛化能力、内存开销、调参难度四个维度的权衡。