文章目录

为什么L1正则化产生稀疏解而L2不会:几何与次梯度解释

发布于 2026-07-22 12:44:19 · 浏览 32 次 · 评论 0 条

为什么L1正则化产生稀疏解而L2不会:几何与次梯度解释

机器学习和统计建模中,正则化是防止过拟合、提升模型泛化能力的核心技术。两种最常用的正则化形式是L1正则化(Lasso)和L2正则化(Ridge)。它们的数学模型看似只差一个平方,但导致的参数解却有天壤之别——L1能使大量参数精确归零,产生稀疏解;而L2只会让参数趋近于零,不会完全归零。这一根本差异的根源在于两者优化问题的几何形状以及目标函数在原点处的导数行为(次梯度)。


1. 从优化问题的几何解释看约束边界

要从根本上理解差异,首先需要重构正则化问题的视角。模型训练的目标通常是最小化经验损失函数 $L(\beta)$(例如均方误差),而正则化项是对模型参数 $\beta$ 施加的额外惩罚。我们以最简单的线性回归为例进行剖析。

1.1 把正则化视为约束优化

L2正则化解决的是以下问题,其中 $\lambda$ 是控制惩罚强度的超参数:

形式 数学表达
惩罚形式 $\min_{\beta} \|y - X\beta\|^2 + \lambda\|\beta\|_2^2$
等价约束形式 $\min_{\beta} \|y - X\beta\|^2 \quad \text{s.t.} \quad \|\beta\|_2^2 \leq t$

相似地,L1正则化的问题可等价写为:

形式 数学表达
惩罚形式 $\min_{\beta} \|y - X\beta\|^2 + \lambda\|\beta\|_1$
等价约束形式 $\min_{\beta} \|y - X\beta\|^2 \quad \text{s.t.} \quad \|\beta\|_1 \leq t$

这两种等价形式将惩罚项转化为对参数向量范数的直接约束。想象解空间:t 定义了一个以原点为中心的“可行区域”,参数不能超出这个区域。而我们寻找的是在此区域内使损失函数值最小的点。

1.2 两个约束区域的直观对比

现在比较L1和L2约束区域的形状,这是几何解释的核心。

L2约束($\ell_2$球): 在二维参数空间($\beta_1$, $\beta_2$)中,$\|\beta\|_2^2 \leq t$ 描述的是一个圆形区域。其边界是光滑的、不存在任何向坐标轴突出的角点。对于更高维空间,它是一个超球形。

L1约束($\ell_1$球,也叫菱形): 在二维空间中,$\|\beta\|_1 \leq t$ 描述的是一个菱形(更准确地说是旋转45度的正方形)。其边界的显著特点是存在尖角,这些尖角精确地位于坐标轴上。(例如,当 $\beta_1 = t, \beta_2 = 0$ 或 $\beta_1 = 0, \beta_2 = t$)。在高维空间中,这个菱形的尖角数量会呈指数级增长,分布在所有坐标轴上。

1.3 损失函数的等高线与“碰撞”点

现在加上损失函数。假设我们有一个经过数据拟合后的损失函数 $L(\beta)$。我们可以画出它在参数空间中的等高线,这些等高线是一簇以无约束最优解(记为 $\hat{\beta}^{OLS}$,即普通最小二乘解)为中心的“椭圆”或“类似椭圆”的环状区域。

我们的优化问题,等同于在限制区域(圆形或菱形)内,找到损失函数值最小的点。由于等高线是向外递增的,所以最优解通常发生在:代表损失函数值的等高线刚好接触到可行区域的边界时。最优点就是那个“接触点”。

现在可以清晰地看到几何上的差异了:

  • 当约束区域是圆形(L2)时,等值线平滑地与圆形边界相切。由于圆形边界处处光滑且没有向外突出的部分,等高线与它的切点有极高的概率落在一个非坐标轴的位置上。这意味着最优解 $\beta^*$ 的两个分量 $\beta_1^*$ 和 $\beta_2^*$ 几乎永远都不会为零。要让其中一个分量为零,需要等高线恰好与坐标轴上的点相切,这在圆形边上几乎不可能出现,除非损失函数本身具有极强的轴对称性。

  • 当约束区域是菱形(L1)时,情况完全不同。菱形的边界拥有突出的尖角(位于坐标轴上)。这些尖角对边界上的其他点来说是“便宜”的——它用更小的距离让参数达到极限。当损失函数的等高线向外扩张时,由于尖角离具有最低损失值的中心区域更近,等高线最有可能与菱形边界在棱角处率先接触。而棱角处正好对应某个分量(或多个分量)为0的情况。例如,接触点如果是 $\beta_1 = t, \beta_2 = 0$,那么 $\beta_2$ 的解就是0。这就是L1正则化更容易得到稀疏解(很多参数为零)的核心几何原因。尖角的存在让“归零”变成概率上的大概率事件。


2. 从次梯度角度解析L1的归零能力

几何解释说明了“为什么是概率上的大概率”,但次梯度给出了为什么L1可以精确归零的严格数学依据,尤其是在最优点位于坐标轴的情况下。

2.1 梯度的定义与L2的平滑性

对于一个可微函数 $f(x)$,在点 $x$ 处的梯度 $f'(x)$ 是唯一的。L2正则化项 $R(\beta) = \lambda \|\beta\|_2^2$ 在定义域内处处可微,其梯度为 $2\lambda \beta$。这意味着在优化过程中,无论参数多么接近0,梯度都能给出一个确定的、非零的(当 $\beta \neq 0$ 时)方向导数。这迫使参数持续受到一个小而确定的“拉力”使其向零点收缩,但永远无法在有限步内精确达到零点。零点对L2来说只是一个吸引子,但永远不会被精确踩到。在数值计算中,L2会让参数无限接近于0,但不会等于0。

2.2 L1的“奇点”:不可微点与次梯度

L1正则化项 $R(\beta) = \lambda \|\beta\|_1 = \lambda \sum_j |\beta_j|$ 截然不同。它在点 $\beta_j = 0$ 处是不可微的——左导数是 $-\lambda$,右导数是 $+\lambda$,函数在此处有一个尖锐的折点。为了定义这种不可微点处的“导数”,我们引入次梯度的概念。

次梯度是一个集合:对于一个凸函数,在点 $x_0$ 处的次梯度是满足以下性质的所有直线斜率的集合:这条直线到处都在函数下方且经过点 $(x_0, f(x_0))$。对于绝对值函数 $f(x) = |x|$:

  • 当 $x > 0$ 时,次梯度是唯一的,即其导数:$\{1\}$。
  • 当 $x < 0$ 时,次梯度是唯一的:$\{-1\}$。
  • 当 $x = 0$ 时,次梯度不是一个点,而是一个区间:$[-1, 1]$。也就是说,任何介于-1和1之间的数,都是绝对值函数在0点处的次梯度。

2.3 最优性条件如何“锁定”零点

一个凸优化问题的最优性条件(Karush-Kuhn-Tucker条件,KKT条件)要求:0必须属于目标函数的子梯度。对于带有L1正则化的损失函数,其目标函数在某个参数 $\beta_j$ 处的次梯度可以写为:

$$\partial \mathcal{L}_{\text{total}} / \partial \beta_j = \partial L(\beta) / \partial \beta_j + \lambda \cdot \partial |\beta_j|$$

其中 $\partial L(\beta) / \partial \beta_j$ 是损失函数 $L$ 对 $\beta_j$ 的梯度(是唯一的值),而 $\partial |\beta_j|$ 是绝对值函数的子梯度。

对于最优点 $\beta_j^*$,最优性条件要求:

$$0 \in \partial L / \partial \beta_j + \lambda \cdot [-1, 1]$$

当 $\beta_j^* = 0$ 时,这个条件变成了:

$$-\partial L / \partial \beta_j (\beta^*) \in \lambda \cdot [-1, 1]$$

翻译成大白话: 只要损失函数 $L$ 在零参数点处对第j个参数的梯度的绝对值不超过 $\lambda$,那么 $\beta_j=0$ 就是一个满足最优性条件的候选解!因为 $\lambda$ 的 “1” 区间正好可以“消化”这个梯度。换句话说,L1正则化的强度 $\lambda$ 创建了一个“死区”。只要某项特征带来的梯度增益不够大(小于 $\lambda$),就会被正则化力量直接归零,而且这个归零是严格的数学解,不是近似。

对于L2正则化,情况不同。最优性条件是:

$$\partial L / \partial \beta_j + 2\lambda \beta_j^* = 0$$

要使 $\beta_j^* = 0$,必须要求 $\partial L / \partial \beta_j = 0$。这就苛刻得多:只有当损失函数本身在原点处的梯度恰好为零,才能得到零解。这在大多数情况下几乎不可能发生——除非数据本身在该维度上完全不提供任何信号。所以L2几乎无法产生精确的零解。


3. 实践中的启示与总结

这两点解释——几何约束边界的形状差异(尖角 vs. 圆滑)和不可微点处的次梯度“死区”机制——共同构成了L1与L2稀疏能力的根本原因。

我们可以用一个简单规则来概括:

  • 当你预期只有少数特征是真正有预测力的,希望模型自动进行特征选择,保留最重要的几个特征时,选用L1正则化。这是Lasso模型的核心。
  • 当你认为所有特征都稍有影响,希望在它们之间均匀地分配权重、防止过拟合,但不强制要求特征归零时,选用L2正则化。这是Ridge回归的核心。

理解它们的数学基础,能帮助你根据不同类型的数据和业务目标,做出正确的正则化选择。 在模型调优中,记住这个几何与梯度的视角,往往比死记硬背公式更有效。

评论 (0)

暂无评论,快来抢沙发吧!

扫一扫,手机查看

扫描上方二维码,在手机上查看本文