首页
文章列表
标签墙
返回找工具啦
优化算法
共 7 篇文章
为什么牛顿法不需要学习率但计算Hessian代价高:二阶信息
2026-07-23 18:36:53
为什么牛顿法不需要学习率但计算Hessian代价高:二阶信息 优化算法是机器学习的核心引擎。在众多算法中,梯度下降法和牛顿法是两种最基础、最典型的方法。理解它们的区别,是理解现代优化技术的钥匙。 问题:为什么梯度下降法需要手动调整学习率,而牛顿法不需要?为什么牛顿法往往收敛更快,却很少有人用? 核心
牛顿法
梯度下降
二阶信息
36
0
非负矩阵分解(NMF)的乘法更新规则与非负约束保证
2026-07-21 00:38:39
非负矩阵分解NMF的乘法更新规则与非负约束保证 非负矩阵分解(NMF)的目标是把一个非负矩阵 $V$ 分解成两个低秩非负矩阵 $W$ 和 $H$,使得 $V \approx WH$。核心难点有两点:如何高效求解(乘法更新规则),以及如何始终保证分解结果是非负的。下面直接拆解这两个问题。 1. 定义问
非负矩阵分解
乘法更新
非负约束
25
0
为什么Nesterov动量比标准动量收敛更快:前瞻梯度修正
2026-07-12 10:39:08
为什么Nesterov动量比标准动量收敛更快:前瞻梯度修正 想象一下,在山谷中滚动一个球来找到最低点。你希望它滚得又快又稳。标准动量就像是给这个球一个持续的推力,让它利用之前的“惯性”继续前进。然而,当球接近谷底时,这个惯性可能太强,导致它“冲过头”,在谷底附近来回摇摆。 Nesterov动量则更聪
Nesterov动量
标准动量
收敛速度
43
0
牛顿法的Hessian修正策略与信赖域dogleg方法
2026-07-06 22:39:50
牛顿法的Hessian修正策略与信赖域dogleg方法 在优化问题中,我们常使用牛顿法来寻找函数的极小点。其核心思想是利用函数在当前点的二次模型(一个抛物面)来逼近原函数,并通过求解这个二次模型的极小点来确定下一步的迭代方向。这个二次模型由梯度(一阶导数)和Hessian矩阵(二阶导数矩阵)共同决定
牛顿法
Hessian修正
信赖域
49
0
非负矩阵分解NMF的乘法更新收敛性与初始化策略
2026-07-05 04:38:11
非负矩阵分解NMF的乘法更新收敛性与初始化策略 非负矩阵分解(NMF)是一种将一个大矩阵拆解为两个更小、非负矩阵的乘积的技术。它在数据压缩、特征提取和模式识别等领域应用广泛。本文将聚焦其最经典的优化算法——乘法更新规则,讲解它为何能稳定收敛,并提供一系列确保算法效果的初始化操作指南。 理解NMF与乘
非负矩阵分解
乘法更新规则
收敛性分析
43
0
牛顿法优化的二次终止性及阻尼牛顿法的全局收敛
2026-07-04 04:44:02
牛顿法优化的二次终止性及阻尼牛顿法的全局收敛 牛顿法是求解优化问题的经典算法。理解它的核心优势(二次终止性)和改进版本(阻尼牛顿法),是掌握高效优化方法的关键。 第一部分:理解牛顿法的“二次终止性” 二次终止性指算法能在有限步内,精确求解二次函数的极值点。牛顿法天然具备这一特性。 1. 明确前提条件
牛顿法
二次终止性
阻尼牛顿法
37
0
梯度下降法的收敛性分析及步长选择策略
2026-06-29 08:44:07
梯度下降法的收敛性分析及步长选择策略 梯度下降法的核心目标是通过迭代找到损失函数的最小值点。迭代能否成功,关键在于收敛,即参数是否能稳定地逼近最优解。步长是控制每一步更新幅度的关键旋钮,选错步长会导致算法震荡、发散甚至完全失效。 1. 理解梯度下降法的基本更新公式 掌握梯度下降法的单步更新规则是分析
梯度下降法
收敛性分析
步长选择
63
0