Appearance
第 8 章:参数估计 (Part II)
这一章是上一章(MLE、CRLB)的理论深化。如果说上一章在教你"怎么估计",这一章就在告诉你"什么样的估计才好""数据里多少信息是真正有用的"。 四大板块:
- 指数族(Exponential Family)
- 充分性(Sufficiency)
- 一致性(Consistency)
- 贝叶斯估计(Bayesian Estimation)
0. 总览:为什么要学这些?
上一章我们学到:
- MLE 是个好估计方法
- Fisher 信息告诉我们参数能被估计得多准
- CRLB 给出了无偏估计方差的下界
但还有几个深刻的问题没回答:
- 拿到
个样本,有没有办法把它们浓缩成几个数字而不丢失关于参数的信息?→ 充分性 - 一类长得"特别好看"的分布(Bernoulli、Normal、Poisson、Gamma...)有什么共同的好性质?→ 指数族
- 当样本量
,估计量会不会收敛到真值?→ 一致性 - 我已有先验知识怎么办?怎么把它和数据结合?→ 贝叶斯估计
1. 指数族(Exponential Family)
1.1 为什么要研究"指数族"?
观察一下我们见过的分布:
| 分布 | pdf 形式 |
|---|---|
| Bernoulli | |
| Poisson | |
| Normal | |
| Gamma |
它们看起来形状各异,但都可以写成同一种形式:
这就是"指数族"。把它们统一起来研究,能一次性证出很多深刻定理。
1.2 严格定义
定义:参数族
:随机 维向量(充分统计量) :参数空间到 的映射(自然参数函数) :和 无关的函数 :归一化常数(保证 pdf 积分为 1)
使得:
其中
1.3 自然参数化(Canonical Form)
最常见的简化形式:直接令
:自然参数(natural parameter) :自然参数空间 - 若
包含一个开集,称该指数族满秩(full rank)
直观:自然参数化就是把分布按"最舒服的坐标"重写一遍。原参数
(比如 Bernoulli 的 )有 的约束,但换成 (log-odds)就可以自由地在 里取值了。
1.4 例 1:Bernoulli
对照定义:
(logit/对数几率)
要点:
和 一一对应( ,正是 sigmoid!)。这就是逻辑回归的来源。
1.5 例 2:Poisson
对照:
1.6 例 3:Normal
对照(注意是 2 维参数):
1.7 例 4:Multinomial(一个坑!)
朴素写法:
但这样写不是满秩!因为约束
修正:消去最后一个
这时:
, (softmax 的反函数!) - 现在
自由,满秩
要点:自然参数维度 = "真正的自由参数"个数。Multinomial 看起来
维,实际只有 个自由度。
1.8 矩生成函数(Moment Generating Function)
定理:自然参数化的指数族,若
证明(很短,关键是用归一化条件):
推论(极有用!):
即:对
例:Bernoulli 验算
回顾上一章:
(指数族里 Fisher 信息 = 充分统计量的方差),现在你知道为什么了:因为 。
2. 充分性(Sufficiency)
2.1 直觉:数据压缩不丢信息
假设你抛硬币 100 次,得到 100 个 0/1。如果有人问你
这就是充分性的精髓:统计量
2.2 严格定义
定义:统计量
解读:知道了
之后,原始数据 不再带任何额外的关于 的信息。 在给定 时的"残余随机性"和参数无关。
2.3 例:二项的充分统计量
- 边际:
- 联合:
(当 )
条件分布:
和
直观解释:知道有
2.4 因子分解定理(Factorization Theorem)
问题:每次都用条件分布去验证太麻烦了。有没有更直接的判定方法?有——这是本章最重要的工具之一。
定理:
其中:
:只通过 依赖于 :完全不依赖
用法:拿到一个 pdf,看它如何随
2.5 推论:指数族的充分统计量
对指数族
| 分布 | 充分统计量 |
|---|---|
| Bernoulli | |
| Poisson | |
| Normal | |
| Multinomial | 各类频数 |
2.6 例:截断族(Truncation Families)
联合 pdf:
按因子分解:
2.7 例:顺序统计量始终是充分的(弱意义)
对任意 i.i.d. 样本:
所以
2.8 最小充分(Minimal Sufficient)
充分统计量不唯一。比如
定义:
直觉:最小充分 = 把数据压缩到不能再压缩,但仍保留所有
信息。
2.9 辅助统计量(Ancillary Statistic)
定义:统计量
例:
意义:辅助统计量"看不见
关键认识:如果一个充分统计量
的某个非常数函数是辅助的,说明 里还混有"和 无关的内容"——它没把数据压缩到极致。 真正"干净"的充分统计量应该满足:它的非常数函数都不能是辅助的。这就引出了完备性。
2.10 完备性(Completeness)
定义:统计量
解读:唯一能让
的函数对所有 期望为 0 的"诚实候选",就是恒等于 0 的那个函数。换言之, 没有"虚假"的随机成分让 偶然为 0。
关键定理:完备 + 充分 ⟹ 最小充分。
指数族大定理:满秩指数族里,自然
2.11 例:Uniform 的
证完备:
设
记
求导:
故
2.12 Basu 定理(漂亮且实用!)
定理:设
意义:常用来"绕开"复杂的联合分布计算。
2.13 Basu 定理的经典应用: 与 独立
设
充分完备(指数族的) 其中 —— 不依赖 ,所以是辅助统计量! - 由 Basu 定理,
由于
进一步:用 m.g.f. 可推出
具体地:
左边第一项
正是
3. 一致性(Consistency)
3.1 直觉
无偏性是"平均行为"——估计量的期望等于真值。但即便无偏,它的方差可能大得离谱。
一致性问的是:当样本量
3.2 严格定义
记作
直观:随着
增大, "落在真值附近"的概率越来越高,最终趋于 1。
3.3 例 1:Uniform 的 是一致的
我们知道
由于
✅
3.4 工具:Chebyshev / Markov 不等式
Markov 不等式:
更一般地,对
Chebyshev 不等式(
最常用形式(取
3.5 例 2:样本均值是一致的
由 Chebyshev:
要点:方差有限 + 渐近无偏 ⟹ 一致。
3.6 MLE 的一致性与渐近最优性
接下来这部分是 本章最深的理论。我们已知:
- MLE 不一定无偏
- CRLB 给出无偏估计的方差下界
核心问题:MLE 在大样本下表现如何?
3.7 渐近正态性 + 渐近最优性
定义:估计量序列
是渐近协方差矩阵 - 若
,则 渐近上更有效
渐近最优的定义:
即渐近方差达到 CRLB 的极限。
3.8 关键定理(MLE 渐近最优)
定理(粗略版):在合适的正则性条件下:
- 似然方程
存在解,且 (一致); - 任何一致的似然方程根
都是渐近最优的,即
意义重大:MLE 在大样本下不仅一致,而且自动达到 CRLB。这就是 MLE 在统计学里地位如此之高的根本原因。
3.9 参数变换下的渐近性
若想估计
并且
——同样达到 CRLB 极限。
4. 贝叶斯估计(Bayesian Estimation)
4.1 频率派 vs. 贝叶斯派
| 频率派(之前学的) | 贝叶斯派 | |
|---|---|---|
| 参数 | 未知常数 | 随机变量 |
| 出发点 | 似然 $f(x | \theta)$ |
| 推理基础 | "重复实验下的频率" | "更新主观信念" |
| 输出 | 点估计 + CI | 后验分布 |
4.2 故事:寻找失踪的核潜艇
1968 年 USS Scorpion 核潜艇失踪。海军专家 John Craven 把可能区域分成
按概率最大的区域
由 Bayes 定理:
更新后得到新概率
最终在 Azores 附近找到了。这就是贝叶斯方法的实战范例。
4.3 简单例子:Poisson 参数
某话务中心 5 分钟来电
这是离散先验。现在观察
所以
对比:先验
4.4 后验分布的一般公式
定义:先验
口诀:后验 ∝ 似然 × 先验。
分母
4.5 例:Beta + Binomial(共轭!)
Max 想估计销售比例
模型:
先验:基于经验,
观察
这恰好是 Beta(
共轭先验(conjugate prior):先验和后验属于同一族分布。Beta 是 Binomial 的共轭。这让计算异常简洁。 取
满足 Max 的要求: ,且大部分质量在 左侧。
4.6 例:Gamma + Poisson(也是共轭!)
先验:Gamma 分布
后验:
即 Gamma(
飓风预测案例:
年里观测 次,先验取 ,后验为 Gamma(252, 150)。
4.7 边际分布(Marginal)
有时候关心的不是
例:Poisson 似然 + Gamma 先验:
这是负二项分布!这解释了为什么"Poisson + Gamma 异质性 → 负二项"——心理学错误率、保险索赔次数等都是这种结构。
4.8 贝叶斯点估计:损失函数 + 风险
后验是个分布,怎样从中提取一个点作为估计?
定义:损失函数
风险(risk) = 损失关于后验分布的期望:
Bayes 估计 = 使风险最小的
4.9 两个最重要的损失函数
定理:
| 损失 | Bayes 估计 |
|---|---|
| $ | \hat\theta - \theta |
| 后验均值 |
平方损失证明(极简):
显然在
绝对损失证明(思路):
设
利用中位数的性质
4.10 例:Poisson + Gamma 的 Bayes 估计
后验是 Gamma
平方损失下 Bayes 估计:
关键观察:把它分解一下:
这是MLE 和先验均值的加权平均!
大(数据多)→ 偏向 MLE 大(先验"权威")→ 偏向先验 → Bayes 估计 → MLE(数据淹没先验)
这是贝叶斯方法的精髓:先验提供初始信念,数据不断更新,最终被数据"主导"。先验"假数据量"为
,真实数据量为 ,按比例混合。
4.11 例:Max 的库存问题(非对称损失)
Max 估计
- 若
:少备货 张,每张损失 元 - 若
:多备货 张,每张存储费 元
这是非对称损失。最优
意义:贝叶斯框架很灵活——你可以根据问题的实际经济损失来设计损失函数,得到针对性的最优决策。
5. 知识体系总览
参数估计 II
|
┌────────────┬──────┴───┬────────────────┐
| | | |
指数族 充分性 一致性 贝叶斯估计
| | | |
┌────┼────┐ ┌──┼──┐ ┌──┼──┐ ┌──┼──┐
定义 自然 各分 充分 因子 完备 依概率 Cheb./ 先验 后验 Bayes
参数 布例 统计 分解 性 收敛 Markov ↓ ↓ 估计
量 定理 (MLE) π(θ) g(θ|x) (loss)
Basu ↓ 平方→均值
✓ X̄⊥S² 渐近最优 绝对→中位数
(达到CRLB)6. 易错点与考点
| 误区 | 正确认识 |
|---|---|
| 充分统计量唯一 | 不!样本本身、顺序统计量都充分。最小充分才唯一(等价类) |
| 充分 ⇒ 完备 | 错!需要单独验证完备性 |
| 完备 ⇒ 充分 | 错!是两个独立概念 |
| MLE 总是最优 | 在大样本下渐近最优,小样本不一定 |
| 一致 ⇒ 无偏 | 错! |
| 无偏 ⇒ 一致 | 错!需要方差也要趋于 0 |
| 共轭先验是唯一选择 | 不!只是计算方便。但任何先验都合法 |
| Bayes 估计就是后验均值 | 不!取决于损失函数 |
| 数据多了就不需要先验 | 对, |
7. 关键公式速查表
| 内容 | 公式 |
|---|---|
| 指数族 | |
| 自然形式 | |
| m.g.f. | |
| 因子分解定理 | |
| 完备性 | |
| Basu 定理 | 完备充分 |
| 一致性 | $\lim_n P( |
| Chebyshev | $P( |
| MLE 渐近 | |
| Bayes 后验 | $g(\theta |
| 平方损失 → | 后验均值 |
| 绝对损失 → | 后验中位数 |
| Beta/Binomial | $\theta |
| Gamma/Poisson | $\theta |
8. 学习路径建议
这一章理论密度高,建议按以下顺序消化:
第一遍(混个脸熟):
- 看懂指数族的统一形式,确认 Bernoulli/Poisson/Normal 都能套进去
- 理解充分性的直觉("压缩不丢信息"),背下因子分解定理
- 一致性 = 弱大数定律的精神
- 贝叶斯就是 "先验 × 似然 ∝ 后验"
第二遍(推导):
- 自己推一遍 Bernoulli 的指数族表达,验证
、 - 自己用因子分解证明 Bernoulli/
充分 - 自己用 Chebyshev 推
一致 - 自己推 Beta + Binomial → Beta 后验
第三遍(理论的味道):
- 完备性的"代数对偶性"——为什么"
" 等价于"没有冗余" - Basu 定理为什么成立的几何直觉("完备充分"和"辅助"是正交方向)
- MLE 渐近最优 = "大样本下达到 CRLB"
- Bayes 估计 = MLE + 先验加权平均(共轭情况下)
9. 与上一章的对照
| 上一章 (MLE/CRLB) | 本章 (扩展) |
|---|---|
| MLE 怎么算 | MLE 在大样本下渐近最优 |
| Fisher 信息 | 在指数族里 |
| CRLB 给方差下界 | MLE 渐近达到 CRLB |
| 无偏性 | 一致性(更弱但更有用) |
| 频率派点估计 | 贝叶斯估计(用先验) |
| 没说"哪些数据有用" | 充分性告诉你"全部有用信息浓缩在 |
| 没强调分布的统一结构 | 指数族给出统一框架 |
如果某一节还卡,告诉我具体页码或概念,我可以再展开讲。祝学习顺利!
10. 专题补充:指数族的结构化读法
指数族的一般形式可写为
更常见的自然参数形式是
这里每一部分都有角色:
| 符号 | 作用 |
|---|---|
| 与参数无关的基准测度 | |
| 自然参数 | |
| 自然统计量 | |
| log normalizer,保证积分为 1 |
10.1 Bernoulli 例子
Bernoulli pmf 为
改写:
因此自然参数是
自然统计量是
log normalizer 为
并且
10.2 Poisson 例子
Poisson pmf:
自然参数:
于是
所以
10.3 Normal 均值例子
若
密度可写为
自然参数为
自然统计量为
这说明很多熟悉分布其实都共享同一套指数族结构。
11. 专题补充:充分性、因子分解与信息压缩
充分统计量回答的问题是:关于参数
11.1 因子分解定理
统计量
其中
11.2 Bernoulli 样本
若
联合 pmf 为
因此
是充分统计量。
解释:只要知道成功次数,样本的具体排列顺序对
11.3 Normal 样本
若
且两个参数都未知,联合密度中的参数相关部分可通过
表达,因此
是充分统计量。
等价地,也可用
表达。
11.4 最小充分性的直觉
充分统计量可能不唯一。最小充分统计量是“不能再压缩而不损失参数信息”的统计量。
直觉:
包含所有原始信息; - 充分统计量保留所有关于参数的信息;
- 最小充分统计量去掉与参数无关的冗余。
12. 专题补充:一致性、渐近正态与 MLE
12.1 一致性的检查思路
估计量
常用证明路线:
- 写出估计量;
- 用 LLN 说明样本均值或样本矩收敛到总体矩;
- 用连续映射定理得到参数函数的收敛。
方法矩估计尤其适合这个套路。
12.2 MLE 一致性的直觉
MLE 最大化样本平均 log-likelihood:
由 LLN,它会接近
在可识别条件下,这个期望在真实参数
12.3 MLE 渐近正态
在正则条件下,
多参数情形为
这条结论连接:
- 第 6 章 CLT;
- 第 7 章 Fisher 信息;
- 本章 MLE 渐近最优;
- 后续回归参数的渐近推断。
13. 专题补充:完备性、Basu 与 UMVU
13.1 完备性的含义
统计量
对所有
对所有
直觉是:
13.2 完备充分统计量为什么重要
Lehmann-Scheffe 定理说:若
这把几个概念串起来:
| 概念 | 作用 |
|---|---|
| 充分 | 不丢参数信息 |
| 完备 | 不含无用冗余 |
| 无偏 | 目标正确 |
| UMVU | 在无偏类中方差最小 |
13.3 Basu 定理的直觉
Basu 定理:完备充分统计量与任何辅助统计量独立。
辅助统计量的分布不依赖参数。直觉上,完备充分统计量承载全部参数信息,而辅助统计量不含参数信息,两者方向正交,因此独立。
经典例子:正态样本中,
14. 专题补充:贝叶斯估计的计算模板
贝叶斯推断的核心公式:
后验 = 似然 × 先验,再归一化。
14.1 Beta-Binomial
若
先验
则后验为
后验均值:
可以写成先验均值和样本比例的加权平均。
14.2 Gamma-Poisson
若
先验
其中
14.3 Bayes estimator
在平方损失下,Bayes 估计量是后验均值:
在绝对损失下,Bayes 估计量是后验中位数。
在 0-1 损失或 MAP 思路下,常看后验众数。
15. 本章复习清单
| 核心内容 | 复习时要能做到 |
|---|---|
| 指数族形式 | 会识别 |
| Bernoulli 指数族 | 会推出 logit 自然参数 |
| Poisson 指数族 | 会由 |
| Normal 指数族 | 知道固定方差时自然统计量是 |
| 因子分解 | 会证明 Bernoulli 的 |
| Normal 充分统计量 | 会写 |
| 一致性 | 会用 LLN + 连续映射证明 |
| MLE 渐近正态 | 能和 Fisher 信息联系 |
| 完备性 | 能解释“无冗余”的含义 |
| Lehmann-Scheffe | 知道完备充分 + 无偏推出 UMVU |
| Basu 定理 | 理解完备充分与辅助统计量独立 |
| Bayes 后验 | 会写 posterior proportional to likelihood times prior |
| 共轭先验 | 会推 Beta-Binomial 和 Gamma-Poisson |
16. 综合深化:共轭更新、MAP 与正则化
16.1 三个典型共轭更新
若
先验中的
若
若
后验均值是先验均值与样本均值按精度加权的结果。
16.2 Bayes 估计取决于损失函数
给定后验分布:平方损失下的 Bayes 估计是后验均值;绝对损失下是后验中位数;0--1 损失的连续近似对应后验众数,即 MAP。因而“最佳后验点估计”必须连同损失函数一起说明。
16.3 MAP 与惩罚估计
MAP 等价于最小化负对数后验:
在线性高斯模型中,独立高斯先验
16.4 后验预测分布
对新观测
只把参数替换成后验均值通常会低估预测不确定性,因为它忽略了参数后验的离散程度。
16.5 充分性与计算压缩
若