首页
文章列表
标签墙
返回找工具啦
收敛速度
共 3 篇文章
为什么Nesterov动量比标准动量收敛更快:前瞻梯度修正
2026-07-12 10:39:08
为什么Nesterov动量比标准动量收敛更快:前瞻梯度修正 想象一下,在山谷中滚动一个球来找到最低点。你希望它滚得又快又稳。标准动量就像是给这个球一个持续的推力,让它利用之前的“惯性”继续前进。然而,当球接近谷底时,这个惯性可能太强,导致它“冲过头”,在谷底附近来回摇摆。 Nesterov动量则更聪
Nesterov动量
标准动量
收敛速度
42
0
蒙特卡洛方法估计圆周率π的收敛速度与方差缩减技术
2026-07-08 06:39:56
蒙特卡洛方法估计圆周率π的收敛速度与方差缩减技术 1. 理解蒙特卡洛方法的核心思想 蒙特卡洛方法利用随机抽样和概率统计来求解数学问题。用它估计圆周率π的思路基于几何概率。 想象一个边长为2的正方形,内切一个半径为1的圆形。正方形的面积是4,圆形的面积是π。那么,随机在正方形内均匀地撒点,点落在圆形内
蒙特卡洛方法
圆周率估计
收敛速度
53
0
为什么Adam优化器比SGD收敛更快:自适应学习率与动量结合
2026-06-30 00:40:07
为什么Adam优化器比SGD收敛更快:自适应学习率与动量结合 1. 理解核心差异:SGD与Adam的起点不同 首先,要明白两者解决的问题相同:寻找一个函数的最小值点(如神经网络的损失函数)。区别在于“下山”的策略。 SGD(随机梯度下降) 像一个固执的登山者。他只看脚下最陡的方向(当前梯度),然后迈
Adam优化器
SGD优化器
自适应学习率
43
0