首页
文章列表
标签墙
返回找工具啦
自适应学习率
共 1 篇文章
为什么Adam优化器比SGD收敛更快:自适应学习率与动量结合
2026-06-30 00:40:07
为什么Adam优化器比SGD收敛更快:自适应学习率与动量结合 1. 理解核心差异:SGD与Adam的起点不同 首先,要明白两者解决的问题相同:寻找一个函数的最小值点(如神经网络的损失函数)。区别在于“下山”的策略。 SGD(随机梯度下降) 像一个固执的登山者。他只看脚下最陡的方向(当前梯度),然后迈
Adam优化器
SGD优化器
自适应学习率
43
0