Appearance
第 6 章:渐近理论与蒙特卡洛模拟
这一章连接“概率模型”与“统计推断”:样本量很大时,随机量会如何稳定?复杂分布算不出时,能否用模拟近似?
0. 本章定位
前面章节主要在精确计算分布。
但统计推断中常遇到两类困难:
- 精确分布太复杂;
- 样本量大时更关心极限近似。
于是有两条路线:
图表渲染中…
1. Monte Carlo 模拟
1.1 思想
如果一个随机变量的真实分布难以手算,就从模型中大量生成样本,用模拟结果近似真实分布。
基本流程:
- 建立随机模型;
- 重复生成随机样本;
- 对每次模拟计算目标量;
- 用直方图、均值、分位数等总结结果;
- 用模拟结果回答概率或决策问题。
1.2 电视保修例子的结构
保修问题可以拆成:
- 两年内维修次数:由故障到达过程决定;
- 每次维修成本:可近似为正态分布;
- 总维修费:维修次数与单次成本共同决定。
若解析分布很麻烦,就模拟很多次“两年使用过程”,比较总维修费超过保修价格的频率。
1.3 Monte Carlo 的关键
Monte Carlo 不是“随便试几次”,它依赖大数定律:
模拟次数越大,模拟平均越接近理论期望。
2. 四种收敛方式
设
2.1 几乎处处收敛
含义:
这是很强的逐路径收敛。
2.2 依概率收敛
含义:对任意
统计中的“一致估计”就是依概率收敛到真值。
2.3 收敛
含义:
例如
2.4 依分布收敛
含义:在
这是最弱但最常用于极限分布的收敛。
3. 收敛关系图
本章中的核心关系可记为:
L^r 收敛 ─┐
├──> 依概率收敛 ───> 依分布收敛
a.s.收敛 ─┘补充:
- 若
,其中极限是常数,则 。 - 依概率收敛可以抽出几乎处处收敛的子序列。
- Borel-Cantelli 型条件可用于证明几乎处处收敛。
4. 随机阶记号 与
4.1 普通阶
表示
表示
4.2 随机阶
表示
表示
常见写法:
意思是样本均值误差通常是
5. 连续映射、Slutsky 与 Delta 方法
5.1 连续映射定理
若
这里的收敛可以是 a.s.、依概率或依分布。
例:
5.2 Slutsky 定理
若
则
用途:把未知参数替换为一致估计量。
5.3 Delta 方法
若
且
多维情形:
典型用途:已知
6. 大数定律 LLN
6.1 强大数定律
若
6.2 弱大数定律
在较弱意义下:
6.3 统计含义
大数定律说明:
- 样本均值会稳定到总体均值;
- Monte Carlo 平均会稳定到理论期望;
- 估计量的一致性通常靠 LLN 证明。
7. 中心极限定理(CLT)
7.1 i.i.d. 版本
若
或者:
7.2 多元 CLT
若
7.3 Lindeberg / Lyapunov 条件
当变量独立但不完全同分布时,需要额外条件保证没有单个变量支配总和。
直觉:
总和近似正态
需要很多“小贡献”叠加
不能由一个“巨大贡献”主导8. 本章知识图谱
图表渲染中…
9. 易错点与考点
| 误区 | 正确认识 |
|---|---|
| 依分布收敛能推出依概率收敛 | 一般不能;极限是常数时可以 |
| 是“概率意义下有界”,不是每个样本路径有界 | |
| Slutsky 中 | 标准形式要求替换项收敛到常数 |
| Delta 方法不需要可微 | 一阶 Delta 需要在极限点可微 |
| LLN 给出正态近似 | LLN 给稳定性,CLT 给正态波动 |
| Monte Carlo 不需要理论支撑 | 它依赖 LLN/CLT 解释误差 |
10. 关键公式速查表
| 内容 | 公式 |
|---|---|
| 依概率收敛 | |
| 依分布收敛 | |
| 随机小 | |
| 连续映射 | |
| Slutsky | |
| Delta 方法 | |
| LLN | |
| CLT |
11. 学习建议
- 先记清四种收敛的强弱关系。
- 看到“估计量是否稳定”,想 LLN 和依概率收敛。
- 看到“估计量误差的分布”,想 CLT。
- 看到“估计量的函数”,想 Delta 方法。
- 看到“用估计量替换未知参数”,想 Slutsky。
- Monte Carlo 题按“生成机制 -> 重复模拟 -> 汇总目标量”的流程写。
12. 专题深化:Monte Carlo 的完整工作流
Monte Carlo 不是“用电脑随便模拟一下”,而是用随机重复试验近似理论概率、期望或分布。它背后的理论正是 LLN 和 CLT。
12.1 Monte Carlo 估计概率
假设目标是估计
做
Monte Carlo 估计量为
由 LLN,
由 CLT,
实际中用
12.2 Monte Carlo 估计期望
若目标是
模拟
标准误近似为
其中
12.3 保修/寿命类模拟的套路
以“产品寿命、保修成本、系统是否失效”为例,完整模拟步骤一般是:
- 明确随机输入,例如每个零件寿命
的分布; - 明确系统规则,例如串联系统取最小寿命,并联系统取最大寿命;
- 明确事件或损失函数,例如
或 repair cost; - 重复模拟
次; - 汇总均值、比例、分位数;
- 报告 Monte Carlo 标准误。
例如估计保修期内失效概率:
估计平均保修成本:
12.4 模拟误差和模型误差要区分
Monte Carlo 误差来自模拟次数有限,可通过增大
模型误差来自你假设的分布不对,例如寿命并不服从指数分布。增加模拟次数不能消除模型误差。
因此报告模拟结果时,应该区分:
| 误差来源 | 如何降低 |
|---|---|
| Monte Carlo 随机误差 | 增大模拟次数、方差缩减 |
| 模型设定误差 | 改进建模、用数据校准 |
| 数值实现误差 | 检查代码、设随机种子、做 sanity check |
13. 专题深化:四种收敛的关系与例子
13.1 几乎处处收敛
表示除一个概率为 0 的异常集合外,对每条样本路径都有普通数列意义下的收敛。
这是很强的收敛形式。强大数定律说:
13.2 依概率收敛
表示对任意
弱大数定律说:
依概率收敛关注“偏离目标的概率是否趋近 0”,不要求每条样本路径最终收敛。
13.3 收敛
表示
当
若
13.4 依分布收敛
表示在
它比依概率收敛弱。CLT 的结论就是依分布收敛:
13.5 强弱关系
常用关系:
但一般不能反推。特别是,依分布收敛到常数时,可以推出依概率收敛:
这是 Slutsky 定理中经常使用的细节。
14. 专题深化:随机大 O、小 o、连续映射与 Slutsky
14.1 随机小
记号
表示
例如若
则
这表示估计误差通常是
14.2 随机大
记号
表示
在渐近推导中经常写:
表示
14.3 连续映射定理
若
且
在相同收敛意义下成立。
例子:
若
14.4 Slutsky 定理
若
则
若
典型用法:CLT 中真实
若
且
15. 专题深化:Delta 方法
Delta 方法解决的问题是:如果估计量
15.1 一阶 Delta 方法
若
且
本质是 Taylor 展开:
15.2 常见例子:比例的 logit 变换
若
取
则
所以
这类变换在比例区间和 logistic 模型中常见。
15.3 当一阶导数为 0
如果
例如
且
这解释了为什么有些函数估计量收敛速度从
16. 专题深化:LLN、CLT 与多元推广
16.1 LLN 给稳定性
若
如果进一步满足强大数定律条件,则
LLN 的作用是说明“样本平均可以估计总体平均”。
16.2 CLT 给波动形状
若
等价地,
在大样本下成立。
LLN 告诉你
16.3 多元 CLT
若
这为多参数估计、回归估计、最大似然渐近正态性提供基础。
16.4 Cramer-Wold 思路
证明多元依分布收敛时,一个常用工具是 Cramer-Wold device:
当且仅当对任意固定向量
直觉是:一个多维分布可以通过所有一维投影刻画。
17. 本章复习清单
| 核心内容 | 复习时要能做到 |
|---|---|
| Monte Carlo 估计概率 | 会写指示变量平均和 MCSE |
| Monte Carlo 估计期望 | 会用样本均值和样本方差报告误差 |
| 保修/寿命模拟 | 会写生成机制、事件规则、汇总目标 |
| 四种收敛 | 能区分 a.s.、p、 |
| 收敛强弱关系 | 会写 |
| 随机 | 能解释估计误差量级 |
| 连续映射 | 会处理估计量函数的一致性 |
| Slutsky | 会用估计标准误替换真实标准差 |
| Delta 方法 | 会写 Taylor 展开和渐近方差 |
| LLN | 知道它给估计稳定性 |
| CLT | 知道它给近似正态和标准误 |
| 多元 CLT | 知道协方差矩阵进入极限分布 |
18. 综合深化:弱收敛、矩收敛与更一般的极限定理
18.1 弱收敛的等价刻画
Portmanteau 定理还给出若干等价表述。例如,对每个有界连续函数
这提醒我们:依分布收敛控制的是“分布形状”,一般不能直接推出矩收敛。若想从分布收敛进一步推出期望收敛,还需要一致可积等附加条件。
Skorohod 表示定理则说明,在适当条件下,可以在另一个共同概率空间上构造同分布版本,使其几乎处处收敛。它是证明工具,并不表示原概率空间上的随机变量已经几乎处处收敛。
18.2 一致可积与矩的收敛
随机变量族
若
这正是“尾部不能悄悄携带大量期望”的数学表达。
18.3 Cramér--Wold 装置
对随机向量
因此,多元渐近正态性常通过任意线性组合的一元 CLT 来证明,再由 Cramér--Wold 装置收回向量结论。
18.4 LLN 不是无条件成立:Cauchy 反例
若
仍服从标准 Cauchy 分布,不会收敛到某个常数。其根源是 Cauchy 分布不存在有限期望,经典大数定律的矩条件不满足。
18.5 高阶 Delta 方法
若
例如
18.6 非同分布情形
独立但非同分布时,不能机械套用 i.i.d. 版本。弱大数定律常要求总体方差之和相对