浙大团队23种优化器评测总结 — 2026年6月3日

浙大团队23种优化器评测总结 — 2026年6月3日

浙大团队23种优化器评测总结

来源:36氪报道《Adam之后选哪个?浙大团队对23种优化器做了迄今最系统的评测》

核心结论

  • AdamW综合最佳:在大多数场景下表现最稳定
  • 没有万能冠军:不同网络结构/任务有各自适配的优化器
  • Lion性价比突出:Google提出的Lion在参数量更少的情况下达到接近AdamW的效果

6大类23种优化器分类总结

🅰 经典动量派

优化器 核心思想
SGD 最原始的随机梯度下降,按batch计算梯度更新参数
SGD + Momentum 引入动量项,累积历史梯度方向,加速收敛、抑制震荡
Nesterov (NAG) “前瞻”式动量——先按动量方向预估下一步位置,再在该位置计算梯度

特点:实现简单、泛化性好;但收敛慢、需要精细调LR。

🅱 自适应学习率派

优化器 核心思想
AdaGrad 每个参数独立LR,用历史梯度平方和做分母——稀疏特征更新大、频繁特征更新小
RMSProp 用指数移动平均代替AdaGrad的累加和,解决LR单调递减到零的问题
Adam RMSProp + Momentum:一阶矩(动量)+ 二阶矩(自适应LR)
AdamW Adam + 解耦权重衰减——正确实现L2正则化,修正了Adam中权重衰减与自适应LR的耦合

特点:自适应LR,调参省心;但泛化性有时不如SGD/动量。

🅲 Adam改进派

优化器 核心思想
RAdam 用整流项修正Adam早期的方差过大问题——前几步不信任动量估计
NAdam Adam + Nesterov动量——结合两派优势
AdaBelief 根据”相信当前梯度”的程度调整步长——梯度与预测一致时大步,分歧时小步
AMSGrad 保证二阶矩估计不递减——解决Adam在某些场景下不收敛的理论缺陷

特点:试图修复Adam的已知缺陷,各有偏重。

🅳 符号/阈值派

优化器 核心思想
SignSGD 只保留梯度符号(+1/-1),大幅降低通信开销
LARS 逐层LR缩放——根据权重范数与梯度范数的比值调整每层的学习率
LAMB LARS的改进版,引入Adam的二阶矩估计——适合大batch训练
Nero 近端归一化梯度——强制每层输出归一化后再更新

特点:关注通信效率和大batch训练场景。

🅴 二阶方法派

优化器 核心思想
KFAC Kronecker因子近似曲率——用Kronecker积分解近似Fisher信息矩阵
Shampoo 预条件矩阵的4阶张量推广——KFAC的泛化形式
SOAP Shampoo的简化版——在子空间上做预条件,降低Shampoo的计算开销

特点:理论上最强(利用曲率信息),但计算开销大。

🅵 前沿新范式派

优化器 核心思想
Lion 符号操作 + 动量——用符号函数做更新,无需二阶矩估计,内存省一半
Muon 正交化梯度更新——在矩阵层面做正交化/谱白化
Sophia 用Hessian对角估计做步长缩放——二阶信息但只需一次额外前向
C-Adam 基于”line of sight”方法的新型Adam变体

特点:2024-2026年的新工作,代表了优化器设计的前沿方向。


总结

浙大团队的评测表明:AdamW是当前最稳健的默认选择,但在特定场景下(如大batch、低精度、低内存)其他优化器可能有更好表现。优化器的选择本质上是对收敛速度、泛化能力、内存开销、调参难度四个维度的权衡。