文章目录

核岭回归与高斯过程回归的等价关系:正则化与先验

发布于 2026-07-31 05:45:55 · 浏览 44 次 · 评论 0 条

核岭回归与高斯过程回归的等价关系:正则化与先验

机器学习的两个经典模型——核岭回归与高斯过程回归——在特定条件下会产生完全相同的预测均值。前者源于正则化理论,后者源于贝叶斯先验假设。以下指南将分阶段带你理解这种等价关系,并直接给出关键公式和步骤。


阶段一:理解核岭回归(正则化视角)

核岭回归是岭回归的“核化”版本,通过将数据映射到高维特征空间并加入L2正则化来防止过拟合。

1. 定义线性岭回归的目标函数

记住:在普通的线性回归中,我们最小化平方误差损失。加入L2正则化后,目标函数变为:

$$ \min_{w} \sum_{i=1}^{n} (y_i - w^T x_i)^2 + \lambda \|w\|^2 $$

其中 $\lambda$ 是正则化系数,控制模型复杂度。$\|w\|^2$ 惩罚权重向量的模长。

2. 推导原始解(原始空间)

对 $w$ 求导并令导数为零,得到闭式解:

$$ w = (X^T X + \lambda I)^{-1} X^T y $$

这里 $X$ 是 $n \times d$ 的设计矩阵(样本数 $n$,特征数 $d$),$y$ 是标签向量。

3. 引入核技巧:转换到对偶空间

当特征维数 $d$ 很大甚至无限时,直接计算 $(X^T X+\lambda I)^{-1}$ 不可行。利用核技巧,将解表示为训练样本的线性组合:$w = X^T \alpha$。代入目标函数并优化 $\alpha$,得到对偶解:

计算 $\alpha = (K + \lambda I)^{-1} y$,其中 $K$ 是核矩阵,元素 $K_{ij} = k(x_i, x_j)$(核函数 $k$ 为内积函数)。预测新点 $x_*$ 时:

输出 $\hat{y}_* = k(x_*)^T (K + \lambda I)^{-1} y$,其中 $k(x_*)$ 是 $n$ 维向量,第 $i$ 分量为 $k(x_*, x_i)$。

4. 理解正则化系数 $\lambda$ 的作用

  • 增大 $\lambda$ → 对权重惩罚更强 → 模型更平滑(偏差高,方差低)。
  • 减小 $\lambda$ → 拟合更紧 → 可能过拟合(方差高,偏差低)。

关键结论:核岭回归仅需选择核函数 $k$ 和正则化参数 $\lambda$,无需显式构造特征映射。


阶段二:理解高斯过程回归(先验视角)

高斯过程是一种贝叶斯非参数模型,直接在函数空间上定义先验分布。

1. 定义高斯过程

高斯过程是一组随机变量(即函数值)的集合,其中任意有限个变量的联合分布服从多元高斯分布。它由均值函数 $m(x)$ 和协方差函数(即核函数)$k(x, x')$ 完全确定:

$$ f(x) \sim \mathcal{GP}(m(x), k(x, x')) $$

通常在回归中假设均值函数为零:$m(x)=0$。

2. 添加观测噪声

假设观测值 $y_i = f(x_i) + \epsilon_i$,其中 $\epsilon_i \sim \mathcal{N}(0, \sigma_n^2)$。联合分布为:

$$ \begin{bmatrix} y \\ f_* \end{bmatrix} \sim \mathcal{N}\left(0, \begin{bmatrix} K + \sigma_n^2 I & K_* \\ K_*^T & K_{**} \end{bmatrix}\right) $$

这里 $K$ 是训练数据的协方差矩阵(即核矩阵),$K_*$ 是测试点与训练点的协方差向量,$K_{**}$ 是测试点的自协方差。

3. 推导后验预测分布

利用条件高斯分布公式,得到在测试点 $x_*$ 处的预测均值与方差:

预测均值:$\bar{f}_* = K_*^T (K + \sigma_n^2 I)^{-1} y$

预测方差:$\text{cov}(f_*) = K_{**} - K_*^T (K + \sigma_n^2 I)^{-1} K_*$

注意:噪声方差 $\sigma_n^2$ 控制数据中的噪声水平。

4. 理解先验与后验的关系

  • 先验:假设函数 $f$ 是平滑的,平滑程度由核函数调节(例如RBF核控制长度尺度)。
  • 后验:观测数据更新先验,使得预测均值通过数据点(或接近数据点),不确定性在无数据区域增大。

关键结论:高斯过程回归完全由核函数 $k$ 和噪声方差 $\sigma_n^2$ 决定,无需指定基函数。


阶段三:揭示等价关系

观察两个模型的预测均值公式:

  • 核岭回归:$\hat{y}_* = k(x_*)^T (K + \lambda I)^{-1} y$
  • 高斯过程回归:$\bar{f}_* = K_*^T (K + \sigma_n^2 I)^{-1} y$

立即发现:如果设 $\lambda = \sigma_n^2$,则两个公式完全一致!这意味着:

  • 核岭回归中的正则化参数 $\lambda$ 等价于高斯过程回归中的噪声方差 $\sigma_n^2$。
  • 核岭回归的预测均值等于高斯过程回归的后验均值。

1. 验证等价的条件

确保核函数 $k$ 在两种模型中完全相同(例如均使用RBF核)。核岭回归没有显式噪声模型,而高斯过程回归假设独立同分布高斯噪声。

2. 理解差异:不确定性量化

  • 核岭回归仅输出点预测,不提供不确定度。
  • 高斯过程回归同时提供预测方差,可构造置信区间。

3. 深层次解读:正则化 vs 先验

  • 核岭回归:从最优化角度,通过惩罚权重来平滑。
  • 高斯过程回归:从概率角度,通过指定核函数作为先验协方差来刻画函数平滑性。
  • 等价性表明:L2正则化等价于假设零均值高斯过程先验,且正则化系数与噪声方差互为倒数关系(严格说,当先验协方差为 $K$,似然噪声方差为 $\sigma_n^2$ 时,后验均值对应 $\lambda = \sigma_n^2$ 的核岭回归)。

阶段四:实操步骤——选择模型

假设你有一个回归任务,需要决定使用核岭回归还是高斯过程回归。按以下步骤操作:

  1. 确定核函数:根据数据先验选择核函数(如RBF、Matern)。
  2. 准备数据:归一化特征,使核函数参数尺度合理。
  3. 训练模型
    • 若使用核岭回归:设置正则化参数 $\lambda$(通过交叉验证选取)。计算核矩阵 $K$,求解 $\alpha = (K+\lambda I)^{-1}y$。
    • 若使用高斯过程回归:设置噪声方差 $\sigma_n^2$(可通过边际似然优化)。计算后验均值和协方差。
  4. 对比预测:两种模型的预测均值在 $\lambda = \sigma_n^2$ 时相同。但高斯过程回归还能给出预测方差,用于数据采集(如贝叶斯优化)或异常检测。
  5. 解释结果:向业务方解释时,可以这样表述:“我们的预测结果相当于在正则化拟合的基础上,附带了每个预测点的置信区间。”

阶段五:扩展到更一般的情况

当模型不是零均值高斯过程时,等价关系稍有调整:核岭回归等价于高斯过程回归在特定先验下的最大后验估计(MAP)。此外,核岭回归只给出点估计,而高斯过程回归提供完整分布,但计算量稍大(需计算矩阵逆)。在现代机器学习中,两种方法常被交替使用,理解其等价性有助于灵活选择工具。

核心要点:正则化参数 $\lambda$ 与噪声方差 $\sigma_n^2$ 的对应是连接两种范式的桥梁。当你下次看到核岭回归的结果时,可以立刻联想到其背后的贝叶斯解释;反之,高斯过程回归的后验均值也可看作一个正则化问题的解。

评论 (0)

暂无评论,快来抢沙发吧!

扫一扫,手机查看

扫描上方二维码,在手机上查看本文