机器学习 共 14 篇文章

核岭回归与高斯过程回归的等价关系:正则化与先验
2026-07-31 05:45:55
核岭回归与高斯过程回归的等价关系:正则化与先验 机器学习的两个经典模型——核岭回归与高斯过程回归——在特定条件下会产生完全相同的预测均值。前者源于正则化理论,后者源于贝叶斯先验假设。以下指南将分阶段带你理解这种等价关系,并直接给出关键公式和步骤。 阶段一:理解核岭回归(正则化视角) 核岭回归是岭回归
核岭回归 高斯过程 正则化
57 0
Frank-Wolfe条件梯度法在约束优化上的投影消除优势
2026-07-29 16:44:09
FrankWolfe条件梯度法在约束优化上的投影消除优势 约束优化问题在机器学习、信号处理、统计学习等领域的出现频率极高。最常见的场景是:在一个封闭凸集中寻找某个光滑凸函数的极小值点。传统的解决方法通常采用投影梯度法,即在每次迭代时,先将梯度下降的结果放到一个临时位置,然后把这个位置“拉回”到可行域
Frank-Wolfe 条件梯度法 约束优化
59 0
为什么协方差矩阵是半正定的:二次型的非负性
2026-07-28 00:36:45
为什么协方差矩阵是半正定的:二次型的非负性 协方差矩阵是统计学和机器学习中最重要的概念之一。许多算法(如PCA、线性判别分析、马氏距离)的有效性,都建立在协方差矩阵的一个关键性质上:它必须是半正定的。理解这个性质,本质上就是理解一个数学事实:任何一个数据集的“方差”,无论你从哪个方向看,都不可能是负
协方差矩阵 半正定 二次型
32 0
在线学习的遗憾界分析:Follow the Regularized Leader算法
2026-07-25 06:43:13
在线学习的遗憾界分析:Follow the Regularized Leader算法 在线学习是一种逐步决策的框架:在第 t 轮,你选择一个动作(如预测值),然后看到损失,目标是最小化累计损失。遗憾衡量你的累计损失与最佳固定动作(事后看)的累计损失之差。Follow the Regularized
在线学习 遗憾界 FTRL算法
32 0
为什么L1正则化产生稀疏解而L2不会:几何与次梯度解释
2026-07-22 12:44:19
为什么L1正则化产生稀疏解而L2不会:几何与次梯度解释 机器学习和统计建模中,正则化是防止过拟合、提升模型泛化能力的核心技术。两种最常用的正则化形式是L1正则化(Lasso)和L2正则化(Ridge)。它们的数学模型看似只差一个平方,但导致的参数解却有天壤之别——L1能使大量参数精确归零,产生稀疏解
L1正则化 L2正则化 稀疏解
33 0
为什么贝叶斯公式中先验概率的选择很关键
2026-07-12 16:40:05
为什么贝叶斯公式中先验概率的选择很关键 贝叶斯公式是数据分析、机器学习等领域进行概率推理的核心工具。其根本思想是:根据新的证据(数据),更新我们对于某个假设或模型的信念。一个常见的误解是,只要数据量足够大,先验概率的选择就无关紧要。本指南将用最直接的方式,解释为什么这个想法是错误的,以及先验选择如何
贝叶斯公式 先验概率 概率推理
74 0
为什么Nesterov动量比标准动量收敛更快:前瞻梯度修正
2026-07-12 10:39:08
为什么Nesterov动量比标准动量收敛更快:前瞻梯度修正 想象一下,在山谷中滚动一个球来找到最低点。你希望它滚得又快又稳。标准动量就像是给这个球一个持续的推力,让它利用之前的“惯性”继续前进。然而,当球接近谷底时,这个惯性可能太强,导致它“冲过头”,在谷底附近来回摇摆。 Nesterov动量则更聪
Nesterov动量 标准动量 收敛速度
44 0
高斯过程回归中核函数选择与超参数边际似然优化
2026-07-12 08:51:13
高斯过程回归中核函数选择与超参数边际似然优化 高斯过程回归 Gaussian Process Regression, GPR 的核心,在于通过一个核函数(也称为协方差函数)来定义数据点之间的相似性。核函数的选择直接决定了模型的预测能力和泛化性能。而核函数中的超参数,则需要通过优化算法来学习。本指南将
高斯过程回归 核函数选择 超参数优化
53 0
为什么稀疏矩阵可以加速计算:压缩存储与稀疏求解
2026-07-08 10:39:41
为什么稀疏矩阵能加速计算:从压缩存储到高效求解 当处理的数据中,绝大多数元素的值为零时,这个数据就是“稀疏的”。在科学计算、机器学习和网络分析中,稀疏矩阵无处不在。如果按常规方式存储和计算,会浪费大量内存和算力。核心加速策略是:只存储和计算非零元素。 1. 识别与定义稀疏矩阵 判断标准:一个 $m
稀疏矩阵 压缩存储 COO格式
61 0
为什么AdaGrad学习率会越来越小:历史梯度平方累积
2026-07-06 00:37:06
为什么AdaGrad学习率会越来越小:历史梯度平方累积 理解 AdaGrad的核心机制,关键在于其计算公式中的历史梯度平方累积项。这个累积项只增不减,直接导致了用于调整参数的步长(学习率)会随着时间推移而持续变小。 1. 理解AdaGrad的“累积”行为 1. 观察 普通梯度下降法的学习率(步长)是
AdaGrad 学习率衰减 梯度平方累积
49 0
支持向量机的对偶问题推导及核函数的Mercer条件
2026-07-04 02:43:27
支持向量机的对偶问题推导及核函数的Mercer条件 支持向量机(SVM)是一种强大的分类算法,其核心思想是寻找一个能最大化“间隔”的超平面来分隔不同类别的数据。为了处理更复杂的情况,并高效地引入核技巧,我们需要推导其对偶形式。 1. 理解原始问题与拉格朗日乘子法 我们的目标是解决一个带约束的优化问题
支持向量机 对偶问题 核函数
43 0
KL散度的非对称性与Jensen-Shannon散度的对称化处理
2026-06-30 10:45:22
KL散度的非对称性与JensenShannon散度的对称化处理 KL散度,全称为KullbackLeibler散度,是衡量两个概率分布差异的核心指标。它有一个关键特性:非对称性。这意味着,用分布 P 去近似分布 Q 的KL散度,与用 Q 去近似 P 的KL散度,结果不相等。这个特性在许多实际场景中(
KL散度 Jensen-Shannon散度 概率分布
46 0
梯度下降法的收敛性分析及步长选择策略
2026-06-29 08:44:07
梯度下降法的收敛性分析及步长选择策略 梯度下降法的核心目标是通过迭代找到损失函数的最小值点。迭代能否成功,关键在于收敛,即参数是否能稳定地逼近最优解。步长是控制每一步更新幅度的关键旋钮,选错步长会导致算法震荡、发散甚至完全失效。 1. 理解梯度下降法的基本更新公式 掌握梯度下降法的单步更新规则是分析
梯度下降法 收敛性分析 步长选择
63 0
为什么过拟合表现为训练集误差为零但测试集误差很大
2026-06-28 00:43:40
为什么过拟合表现为训练集误差为零但测试集误差很大 核心结论:当模型在训练集上达到误差为零时,它很可能没有学会数据中普遍的规律,而是死记硬背了训练数据的全部细节,包括其中的噪声和偶然规律。这导致它在面对新数据(测试集)时,无法进行有效的判断,从而误差飙升。 第一阶段:理解“训练集误差为零”的本质 要理
过拟合 训练集误差 测试集误差
71 0