Skip to content

第 6 章:渐近理论与蒙特卡洛模拟

这一章连接“概率模型”与“统计推断”:样本量很大时,随机量会如何稳定?复杂分布算不出时,能否用模拟近似?


0. 本章定位

前面章节主要在精确计算分布。
但统计推断中常遇到两类困难:

  1. 精确分布太复杂;
  2. 样本量大时更关心极限近似。

于是有两条路线:

图表渲染中…


1. Monte Carlo 模拟

1.1 思想

如果一个随机变量的真实分布难以手算,就从模型中大量生成样本,用模拟结果近似真实分布。

基本流程:

  1. 建立随机模型;
  2. 重复生成随机样本;
  3. 对每次模拟计算目标量;
  4. 用直方图、均值、分位数等总结结果;
  5. 用模拟结果回答概率或决策问题。

1.2 电视保修例子的结构

保修问题可以拆成:

  • 两年内维修次数:由故障到达过程决定;
  • 每次维修成本:可近似为正态分布;
  • 总维修费:维修次数与单次成本共同决定。

若解析分布很麻烦,就模拟很多次“两年使用过程”,比较总维修费超过保修价格的频率。

1.3 Monte Carlo 的关键

Monte Carlo 不是“随便试几次”,它依赖大数定律:

1Ni=1Nh(Xi)E[h(X)]

模拟次数越大,模拟平均越接近理论期望。


2. 四种收敛方式

Xn,X 为随机向量。

2.1 几乎处处收敛

Xna.s.X

含义:

P(limnXn=X)=1

这是很强的逐路径收敛。

2.2 依概率收敛

XnpX

含义:对任意 ε>0

limnP(XnX>ε)=0

统计中的“一致估计”就是依概率收敛到真值。

2.3 Lr 收敛

XnLrX

含义:

EXnXr0

例如 L2 收敛要求均方误差趋于 0。

2.4 依分布收敛

XndX

含义:在 X 的 CDF 连续点上,

FXn(x)FX(x)

这是最弱但最常用于极限分布的收敛。


3. 收敛关系图

本章中的核心关系可记为:

L^r 收敛 ─┐
         ├──> 依概率收敛 ───> 依分布收敛
a.s.收敛 ─┘

补充:

  • Xndc,其中极限是常数,则 Xnpc
  • 依概率收敛可以抽出几乎处处收敛的子序列。
  • Borel-Cantelli 型条件可用于证明几乎处处收敛。

4. 随机阶记号 Opop

4.1 普通阶

an=O(bn)

表示 |an| 至多与 |bn| 同阶。

an=o(bn)

表示 an/bn0

4.2 随机阶

Xn=Op(an)

表示 Xn/an 在概率意义下有界。

Xn=op(an)

表示

Xn/anp0

常见写法:

X¯μ=Op(n1/2)

意思是样本均值误差通常是 1/n 量级。


5. 连续映射、Slutsky 与 Delta 方法

5.1 连续映射定理

XnX,且 g 连续,则

g(Xn)g(X)

这里的收敛可以是 a.s.、依概率或依分布。

例:

XndN(0,1)Xn2dχ12

5.2 Slutsky 定理

XndX,Ynpc

Xn+YndX+cXnYndcXXnYndXc,c0

用途:把未知参数替换为一致估计量。

5.3 Delta 方法

an(Xnc)dY,an

gc 可微,则

an[g(Xn)g(c)]dg(c)Y

多维情形:

an[g(Xn)g(c)]dg(c)Y

典型用途:已知 θ^ 的渐近分布,求 g(θ^) 的渐近分布。


6. 大数定律 LLN

6.1 强大数定律

X1,X2, i.i.d. 且 E|X1|<,则

1ni=1nXia.s.E(X1)

6.2 弱大数定律

在较弱意义下:

1ni=1nXipE(X1)

6.3 统计含义

大数定律说明:

  • 样本均值会稳定到总体均值;
  • Monte Carlo 平均会稳定到理论期望;
  • 估计量的一致性通常靠 LLN 证明。

7. 中心极限定理(CLT)

7.1 i.i.d. 版本

X1,,Xn i.i.d.,E(Xi)=μVar(Xi)=σ2<,则

n(X¯μ)σdN(0,1)

或者:

n(X¯μ)dN(0,σ2)

7.2 多元 CLT

Xik 维随机向量,E(Xi)=μVar(Xi)=Σ,则

1ni=1n(Xiμ)dNk(0,Σ)

7.3 Lindeberg / Lyapunov 条件

当变量独立但不完全同分布时,需要额外条件保证没有单个变量支配总和。

直觉:

总和近似正态
  需要很多“小贡献”叠加
  不能由一个“巨大贡献”主导

8. 本章知识图谱

图表渲染中…


9. 易错点与考点

误区正确认识
依分布收敛能推出依概率收敛一般不能;极限是常数时可以
Op(1) 等于有界是“概率意义下有界”,不是每个样本路径有界
Slutsky 中 Yn 可以收敛到随机变量标准形式要求替换项收敛到常数
Delta 方法不需要可微一阶 Delta 需要在极限点可微
LLN 给出正态近似LLN 给稳定性,CLT 给正态波动
Monte Carlo 不需要理论支撑它依赖 LLN/CLT 解释误差

10. 关键公式速查表

内容公式
依概率收敛P(|XnX|>ε)0
依分布收敛FXn(x)FX(x)
Lr 收敛E|XnX|r0
随机小 oXn=op(an)Xn/anp0
连续映射XnXg(Xn)g(X)
SlutskyXndX,YnpcXnYndcX
Delta 方法an[g(Xn)g(c)]dg(c)Y
LLNX¯E(X)
CLTn(X¯μ)/σdN(0,1)

11. 学习建议

  1. 先记清四种收敛的强弱关系。
  2. 看到“估计量是否稳定”,想 LLN 和依概率收敛。
  3. 看到“估计量误差的分布”,想 CLT。
  4. 看到“估计量的函数”,想 Delta 方法。
  5. 看到“用估计量替换未知参数”,想 Slutsky。
  6. Monte Carlo 题按“生成机制 -> 重复模拟 -> 汇总目标量”的流程写。

12. 专题深化:Monte Carlo 的完整工作流

Monte Carlo 不是“用电脑随便模拟一下”,而是用随机重复试验近似理论概率、期望或分布。它背后的理论正是 LLN 和 CLT。

12.1 Monte Carlo 估计概率

假设目标是估计

p=P(A).

B 次独立模拟,定义

Ib={1,第 b 次模拟中事件 A 发生,0,否则.

Monte Carlo 估计量为

p^B=1Bb=1BIb.

由 LLN,

p^Bp.

由 CLT,

p^Bpp(1p)/BN(0,1).

实际中用 p^B 替换 p,Monte Carlo 标准误为

MCSE(p^B)p^B(1p^B)B.

12.2 Monte Carlo 估计期望

若目标是

θ=E[g(X)],

模拟 X1,,XB,估计

θ^B=1Bb=1Bg(Xb).

标准误近似为

MCSE(θ^B)=sgB,

其中 sg2g(X1),,g(XB) 的样本方差。

12.3 保修/寿命类模拟的套路

以“产品寿命、保修成本、系统是否失效”为例,完整模拟步骤一般是:

  1. 明确随机输入,例如每个零件寿命 Ti 的分布;
  2. 明确系统规则,例如串联系统取最小寿命,并联系统取最大寿命;
  3. 明确事件或损失函数,例如 I(T<warranty) 或 repair cost;
  4. 重复模拟 B 次;
  5. 汇总均值、比例、分位数;
  6. 报告 Monte Carlo 标准误。

例如估计保修期内失效概率:

p^=1Bb=1BI(Tb<w).

估计平均保修成本:

c^=1Bb=1BCb.

12.4 模拟误差和模型误差要区分

Monte Carlo 误差来自模拟次数有限,可通过增大 B 降低,通常以 1/B 速度下降。

模型误差来自你假设的分布不对,例如寿命并不服从指数分布。增加模拟次数不能消除模型误差。

因此报告模拟结果时,应该区分:

误差来源如何降低
Monte Carlo 随机误差增大模拟次数、方差缩减
模型设定误差改进建模、用数据校准
数值实现误差检查代码、设随机种子、做 sanity check

13. 专题深化:四种收敛的关系与例子

13.1 几乎处处收敛

XnXa.s.

表示除一个概率为 0 的异常集合外,对每条样本路径都有普通数列意义下的收敛。

这是很强的收敛形式。强大数定律说:

X¯nμa.s.

13.2 依概率收敛

XnpX

表示对任意 ε>0

P(|XnX|>ε)0.

弱大数定律说:

X¯npμ.

依概率收敛关注“偏离目标的概率是否趋近 0”,不要求每条样本路径最终收敛。

13.3 Lr 收敛

XnLrX

表示

E|XnX|r0.

r=2 时,常用于均方误差:

MSE(Xn)=E[(XnX)2].

XnLrX,则 XnpX

13.4 依分布收敛

XndX

表示在 X 的连续点处,

FXn(x)FX(x).

它比依概率收敛弱。CLT 的结论就是依分布收敛:

n(X¯μ)σdN(0,1).

13.5 强弱关系

常用关系:

a.s.pd,Lrpd.

但一般不能反推。特别是,依分布收敛到常数时,可以推出依概率收敛:

XndcXnpc.

这是 Slutsky 定理中经常使用的细节。


14. 专题深化:随机大 O、小 o、连续映射与 Slutsky

14.1 随机小 o

记号

Xn=op(an)

表示

Xnanp0.

例如若

n(θ^θ)=Op(1),

θ^θ=Op(n1/2).

这表示估计误差通常是 1/n 量级。

14.2 随机大 O

记号

Xn=Op(an)

表示 Xn/an 在概率意义下有界。直观地说,Xn 的典型大小不超过 an 的阶。

在渐近推导中经常写:

θ^θ=Op(n1/2)

表示 θ^ 是 root-n consistent。

14.3 连续映射定理

XnX,

g 连续,则

g(Xn)g(X)

在相同收敛意义下成立。

例子:

σ^2pσ2,且 σ2>0,则

σ^=σ^2pσ.

14.4 Slutsky 定理

XndX,Ynpc,

Xn+YndX+c,XnYndcX,

c0

XnYndXc.

典型用法:CLT 中真实 σ 未知时,用一致估计 σ^ 替换。

n(X¯μ)σdN(0,1),

σ^pσ,则

n(X¯μ)σ^dN(0,1).

15. 专题深化:Delta 方法

Delta 方法解决的问题是:如果估计量 θ^ 渐近正态,那么函数 g(θ^) 的渐近分布是什么。

15.1 一阶 Delta 方法

n(θ^θ)dN(0,σ2),

g(θ)0,则

n(g(θ^)g(θ))dN(0,[g(θ)]2σ2).

本质是 Taylor 展开:

g(θ^)=g(θ)+g(θ)(θ^θ)+op(θ^θ).

15.2 常见例子:比例的 logit 变换

n(p^p)dN(0,p(1p)),

g(p)=logp1p,

g(p)=1p(1p).

所以

n(g(p^)g(p))dN(0,1p(1p)).

这类变换在比例区间和 logistic 模型中常见。

15.3 当一阶导数为 0

如果 g(θ)=0,一阶 Delta 方法给出退化分布,需要看二阶项。

例如

n(θ^θ)dZ,

g(θ)=0,g(θ)0,则

n(g(θ^)g(θ))d12g(θ)Z2.

这解释了为什么有些函数估计量收敛速度从 n 变成 n,极限分布也不再正态。


16. 专题深化:LLN、CLT 与多元推广

16.1 LLN 给稳定性

X1,,Xn iid,E(Xi)=μ,则

X¯npμ.

如果进一步满足强大数定律条件,则

X¯nμa.s.

LLN 的作用是说明“样本平均可以估计总体平均”。

16.2 CLT 给波动形状

Xi iid,E(Xi)=μVar(Xi)=σ2<,则

n(X¯nμ)σdN(0,1).

等价地,

X¯nN(μ,σ2n)

在大样本下成立。

LLN 告诉你 X¯n 往哪里去;CLT 告诉你它以什么形状、什么尺度在目标附近波动。

16.3 多元 CLT

Xip 维随机向量,均值为 μ,协方差矩阵为 Σ,则

n(X¯μ)dNp(0,Σ).

这为多参数估计、回归估计、最大似然渐近正态性提供基础。

16.4 Cramer-Wold 思路

证明多元依分布收敛时,一个常用工具是 Cramer-Wold device:

XndX

当且仅当对任意固定向量 a

aXndaX.

直觉是:一个多维分布可以通过所有一维投影刻画。


17. 本章复习清单

核心内容复习时要能做到
Monte Carlo 估计概率会写指示变量平均和 MCSE
Monte Carlo 估计期望会用样本均值和样本方差报告误差
保修/寿命模拟会写生成机制、事件规则、汇总目标
四种收敛能区分 a.s.、p、Lr、d
收敛强弱关系会写 a.s.pd
随机 Op/op能解释估计误差量级
连续映射会处理估计量函数的一致性
Slutsky会用估计标准误替换真实标准差
Delta 方法会写 Taylor 展开和渐近方差
LLN知道它给估计稳定性
CLT知道它给近似正态和标准误
多元 CLT知道协方差矩阵进入极限分布

18. 综合深化:弱收敛、矩收敛与更一般的极限定理

18.1 弱收敛的等价刻画

XndX 的分布函数定义是:在 FX 的每个连续点 x,都有

FXn(x)FX(x).

Portmanteau 定理还给出若干等价表述。例如,对每个有界连续函数 f

Ef(Xn)Ef(X).

这提醒我们:依分布收敛控制的是“分布形状”,一般不能直接推出矩收敛。若想从分布收敛进一步推出期望收敛,还需要一致可积等附加条件。

Skorohod 表示定理则说明,在适当条件下,可以在另一个共同概率空间上构造同分布版本,使其几乎处处收敛。它是证明工具,并不表示原概率空间上的随机变量已经几乎处处收敛。

18.2 一致可积与矩的收敛

随机变量族 {Xn} 一致可积,是指

\lim_{M\to\infty}\sup_n \mathbb E\!left[|X_n|\mathbf 1\{|X_n|>M\}\right]=0.

XnpX{Xn} 一致可积,则 XnXL1 中成立。一个常用的充分条件是:存在 δ>0,使

supnE|Xn|1+δ<.

这正是“尾部不能悄悄携带大量期望”的数学表达。

18.3 Cramér--Wold 装置

对随机向量 Xn,XRd,有

XndXaXndaX,aRd.

因此,多元渐近正态性常通过任意线性组合的一元 CLT 来证明,再由 Cramér--Wold 装置收回向量结论。

18.4 LLN 不是无条件成立:Cauchy 反例

Xi 独立同分布且服从标准 Cauchy 分布,则

X¯n=1ni=1nXi

仍服从标准 Cauchy 分布,不会收敛到某个常数。其根源是 Cauchy 分布不存在有限期望,经典大数定律的矩条件不满足。

18.5 高阶 Delta 方法

n(Tnθ)dN(0,τ2),但 g(θ)=0,一阶 Delta 方法会退化。若 g(θ)0,二阶 Taylor 展开给出

n{g(Tn)g(θ)}d12g(θ)τ2χ12.

例如 g(x)=x2:当 θ0 时用一阶 Delta 方法;当 θ=0 时必须改用二阶展开,收敛速度也由 n 变为 n

18.6 非同分布情形

独立但非同分布时,不能机械套用 i.i.d. 版本。弱大数定律常要求总体方差之和相对 n2 足够小;中心极限定理则可用 Lindeberg 或 Lyapunov 条件控制“单个观测支配总波动”的风险。共同思想是:总随机波动应由许多小贡献组成,而不是被少数极端项主导。