随机梯度下降(SGD)优化器与 Adam 优化器相比,通常的特点是:
Adam 优化器需要手动调整的学习率,而 SGD 具有自适应学习率
SGD 对学习率的初始值和衰减策略更敏感,但可能在某些情况下获得更好的泛化性能
Adam 优化器在计算上比 SGD 更高效,不需要存储额外的动量信息
SGD 能够更好地处理稀疏梯度问题