首页
文章列表
标签墙
返回找工具啦
梯度下降
共 4 篇文章
为什么牛顿法不需要学习率但计算Hessian代价高:二阶信息
2026-07-23 18:36:53
为什么牛顿法不需要学习率但计算Hessian代价高:二阶信息 优化算法是机器学习的核心引擎。在众多算法中,梯度下降法和牛顿法是两种最基础、最典型的方法。理解它们的区别,是理解现代优化技术的钥匙。 问题:为什么梯度下降法需要手动调整学习率,而牛顿法不需要?为什么牛顿法往往收敛更快,却很少有人用? 核心
牛顿法
梯度下降
二阶信息
37
0
为什么Nesterov动量比标准动量收敛更快:前瞻梯度修正
2026-07-12 10:39:08
为什么Nesterov动量比标准动量收敛更快:前瞻梯度修正 想象一下,在山谷中滚动一个球来找到最低点。你希望它滚得又快又稳。标准动量就像是给这个球一个持续的推力,让它利用之前的“惯性”继续前进。然而,当球接近谷底时,这个惯性可能太强,导致它“冲过头”,在谷底附近来回摇摆。 Nesterov动量则更聪
Nesterov动量
标准动量
收敛速度
44
0
牛顿法优化的二次终止性及阻尼牛顿法的全局收敛
2026-07-04 04:44:02
牛顿法优化的二次终止性及阻尼牛顿法的全局收敛 牛顿法是求解优化问题的经典算法。理解它的核心优势(二次终止性)和改进版本(阻尼牛顿法),是掌握高效优化方法的关键。 第一部分:理解牛顿法的“二次终止性” 二次终止性指算法能在有限步内,精确求解二次函数的极值点。牛顿法天然具备这一特性。 1. 明确前提条件
牛顿法
二次终止性
阻尼牛顿法
38
0
为什么Adam优化器比SGD收敛更快:自适应学习率与动量结合
2026-06-30 00:40:07
为什么Adam优化器比SGD收敛更快:自适应学习率与动量结合 1. 理解核心差异:SGD与Adam的起点不同 首先,要明白两者解决的问题相同:寻找一个函数的最小值点(如神经网络的损失函数)。区别在于“下山”的策略。 SGD(随机梯度下降) 像一个固执的登山者。他只看脚下最陡的方向(当前梯度),然后迈
Adam优化器
SGD优化器
自适应学习率
43
0