大偏差理论中的速率函数与Sanov定理
要理解一个极端事件发生的概率,常规的中心极限定理可能无能为力。大偏差理论提供了一套系统的方法来量化这类小概率事件。其核心工具是速率函数,它描述了偏离典型行为的“代价”。Sanov定理是这套理论的基石,它精确地告诉我们在独立重复试验中,观察到的经验分布偏离真实分布的速率。
1. 理解大偏差的核心问题:速率函数
大偏差理论处理形如 P(S_n/n ≈ x) 的概率,其中 S_n 是 n 次独立试验的总和或某个统计量,而 x 是一个偏离了期望值的固定值。当 n 非常大时,这个概率会指数级衰减。
-
建立指数衰减的直觉:这个概率大致遵循公式
P(S_n/n ≈ x) ≈ e^{-n I(x)}。这里,e是自然常数,n是试验次数,I(x)就是速率函数。速率函数 量化了 观察到均值x所需的“指数级难度”。I(x)越大,这个事件发生的概率越小。 -
定义速率函数:速率函数
I(x)本身是一个非负函数。它的最小值(通常为零)出现在事件的最可能结果上,比如随机变量的期望值。偏离这个最可能结果越远,I(x)的值就越大。它衡量了偏离的“信息代价”或“自由能惩罚”。
2. 从具体到抽象:构建Sanov定理的直觉
Sanov定理是大偏差原理在概率测度空间上的一个重要实例。它处理的不再是单个均值,而是整个经验分布。
-
设定场景:假设我们进行
n次独立同分布的试验,每次结果来自一个概率分布P。我们收集 所有结果,然后统计 每个可能结果出现的频率,这就得到了一个经验分布L_n,它是一个描述数据“长相”的数学对象。 -
提出问题:当试验次数
n趋于无穷时,根据大数定律,经验分布L_n会稳定地收敛到真实的分布P。那么,如果我们观察到一个与P不同的“奇怪”经验分布Q,这个事件发生的概率有多小? -
引入核心度量:相对熵(KL散度):要量化两个分布
Q和P之间的“差异”或“信息距离”,我们使用相对熵,记为D(Q || P)。它的一个重要性质是D(Q || P) ≥ 0,且仅当Q = P时等号成立。计算 这个值的公式为:
$$D(Q || P) = \sum_{x} Q(x) \log \frac{Q(x)}{P(x)}$$
对于连续分布,将求和改为积分即可。它直观上衡量了用分布P去编码来自分布Q的数据所浪费的平均额外信息量。
3. Sanov定理的完整表述与含义
结合前面的铺垫,我们可以清晰地陈述Sanov定理。
-
陈述定理:设
P是一个定义在有限状态空间上的概率分布。令L_n为基于n次独立同分布抽样(服从分布P)得到的经验分布。对于一个集合A中的任何概率分布Q,经验分布L_n落在集合A内的概率满足以下大偏差原理:
$$-\inf_{Q \in \text{int}(A)} D(Q || P) \leq \liminf_{n \to \infty} \frac{1}{n} \log P(L_n \in A) \leq \limsup_{n \to \infty} \frac{1}{n} \log P(L_n \in A) \leq -\inf_{Q \in \text{cl}(A)} D(Q || P)$$ -
解读定理:这个复杂的公式揭示了 核心结论:观察到的经验分布
L_n处于一个特定集合A中的概率,其衰减速率由集合A内所有分布与真实分布P之间的最小相对熵决定。通俗地说,最有可能 成为“奇怪”经验分布Q的,是那个与P“距离”(即D(Q || P))最近的Q。定理中的int(A)和cl(A)分别指集合A的内部和闭包,这涉及到拓扑细节,在初等应用中可以粗略理解为A本身。 -
简化与应用:在最简单的情形下,如果我们只关心经验分布等于某个特定分布
Q这一个事件,Sanov定理告诉我们:
$$P(L_n \approx Q) \approx e^{-n D(Q || P)}$$
这时,相对熵D(Q || P)就成为了这个特定偏差事件的速率函数。它精确地刻画了看到经验分布Q而不是真实分布P的指数级概率。
4. 总结Sanov定理的核心要点
-
速率函数的实例:在分布空间的大偏差理论中,相对熵
D(Q || P)充当了速率函数I(Q)的角色。它衡量了 用经验分布Q替代真实分布P的“困难程度”。 -
定理的普适性:Sanov定理为分析许多统计推断问题提供了强大框架。例如,假设检验中的错误概率衰减率、经验风险最小化中估计误差的概率等,都可以从Sanov定理的角度得到深刻理解。
-
从算术平均到分布:该定理是大数定律的精细化补充。大数定律说经验分布会稳定到
P;Sanov定理则精确描述了 它以多快的速度偏离,以及偏离到不同地方Q的相对可能性。

暂无评论,快来抢沙发吧!