Appearance
第 7 章:参数估计(Estimation)
四大板块:
- 最大似然估计(MLE)
- 区间估计(置信区间)
- 估计量的性质(无偏性、有效性)
- Fisher 信息矩阵与 Cramér–Rao 下界
0. 什么是"参数估计"?先把问题讲清楚
在统计学里,我们通常假设数据来自某个带未知参数的分布。比如:
- 抛硬币:
,参数 未知 - 顾客到达数:
,参数 未知 - 测量误差:
,参数 未知
参数估计要回答的问题:拿到一组样本
- 点估计:给出一个具体的数字,比如
- 区间估计:给出一个区间,比如
,并说明"我有 95% 把握"
1. 最大似然估计(Maximum Likelihood Estimation, MLE)
1.1 直觉:抛三次硬币的例子
假设一枚硬币正面概率为
设
观察到
关键思想:既然这件事真的发生了,那就找一个
对
令其为 0,得
这就是最大似然的核心思想:找让已发生数据出现概率最大的参数值。
1.2 似然函数的定义
定义:给定样本
(离散情形把
⚠ 注意:似然函数
是 的函数,数据 是已经知道的、固定的常数!这是最容易混淆的地方。
最大似然估计量(MLE)
1.3 求解套路(标准流程)
由于连乘的求导很麻烦,通常先取对数(对数是单调函数,不改变最大值位置):
步骤 1:写出似然函数
1.4 例 1:Poisson 分布
题目:
Poisson 分布:
第一步:写似然
(其中
第二步:取对数
第三步:求导
推广:对 i.i.d. 样本
即样本均值——这和我们直觉一致(Poisson 的期望就是
1.5 例 2:双参数指数(备用设备故障时间)
题目:两个独立指数设备之和
似然:
对数似然:
求导并令为 0:
代入数据:
1.6 例 3:顺序统计量情形(导数不起作用!)
重点:不是所有 MLE 都能靠求导解出来。
当 pdf 的定义域与参数
题目:
似然:
求导?
改用直接观察:
因此:
记住:定义域含参数时 → 别求导,看范围约束 → MLE 往往是
或 。
1.7 多参数情形:Normal 分布
题目:
对数似然:
对
对
代入
⚠ 注意分母是
,不是 !—— 后面会证明这是有偏估计,需要用 修正成样本方差 。
1.8 矩估计法(Method of Moments, MoM)
MLE 很好用,但有时候(比如 Gamma 分布里涉及
核心思想:理论矩 = 样本矩。
对有
解这个方程组就得到
例:
只有 1 个参数,所以只需要 1 阶矩。
令其
代入数据(0.42, 0.10, 0.65, 0.23),
例:Gamma 分布
已知
联立:
解出:
2. 区间估计(Interval Estimation)
2.1 为什么要区间估计?
点估计给出一个具体数字,但没说它"多准"。比如
区间估计:给出一个范围,并声明"有
2.2 正态总体均值的置信区间(已知 )
例:数据 6.5, 9.2, 9.9, 12.4,
关键工具:
因此:
"反转"这个概率(把
代入
解读:我们有 95% 的把握说真实均值
⚠ 严格地说:不是"
有 95% 的概率在这个区间里"( 是固定的数!),而是"这种造区间的方法,长期重复使用 95% 的区间会包含真值"。
2.3 二项分布参数 的置信区间
定理:
例:Gallup 调查 1012 人,810 支持,
2.4 误差范围(Margin of Error, MOE)
注意到 CI 宽度:
由于
定义:95% CI 的误差范围为
这就是新闻里常说的"误差 ±3%""±4%"的由来。
例:
重要理解:MOE 只和
2.5 样本量的确定
问题:想让
定理:
推导:由
例:要求 98% 把握误差不超过 0.05。
3. 估计量的性质
同一个参数,可能有多个估计量。哪个更好?两大标准:无偏性 + 有效性。
3.1 无偏性(Unbiasedness)
定义:估计量
直观:平均来说,
例 1:
考虑两个估计量:
计算
所以
例 2: 对应的无偏方差(重要!)
是否无偏?
所以
修正:乘以
这就是为什么样本方差分母是
3.2 有效性(Efficiency)
两个估计量都无偏时,谁的方差更小,谁就更"有效"(估计更集中在真值附近)。
定义:若
相对有效性:
例:正态均值的两个估计
(即 )
两者都无偏(系数和为 1)。比方差:
由于
一般结论:对
( ,保证无偏),由 Cauchy–Schwarz, 的最小值在 时取到。即算术平均是最有效的线性无偏估计。
4. Fisher 信息矩阵与 Cramér–Rao 下界
这是本章的理论巅峰,回答一个根本问题:一个无偏估计量的方差能小到什么程度?
4.1 直觉:信息 = 数据告诉我们参数的"多少"
考虑对数似然
- 如果
在真值附近非常"尖"(二阶导很负),说明数据对 反应灵敏 → 信息量大 - 如果
很"平",说明稍微移动 对似然几乎没影响 → 信息量小
4.2 Fisher 信息(单参数)
定义:
这个东西叫得分函数(score)的方差。
等价形式(在正则性条件下,即积分/求导可换序):
这个形式更直观:对数似然的曲率期望 = 信息量。曲率越大(二阶导越负),信息越多。
4.3 多参数:Fisher 信息矩阵
等价地:
(这是一个
4.4 参数变换下的信息
若
这就是信息随参数化的链式法则。
4.5 Cramér–Rao 下界(CRLB)
定理:设
特例:若
物理含义:任何无偏估计量的方差都不可能小于
- 所以
越大,方差下界越小,我们能做得越好 - 如果某个无偏估计达到了 CRLB,它就是最有效的(称为有效估计量)
4.6 证明思路(一维情形)
要证:
关键等式:
(得分函数均值为 0) 推导:
。 由 1 知
。 。 推导:
再减去
,就得到 Cov。 用 Cauchy–Schwarz:
即
,整理得证。
4.7 指数族的特别结论
命题:若
- 正则性条件自动满足
- 若
是关于自然参数 的 Fisher 信息矩阵,则 - 若
是关于 的 Fisher 信息,则
结论:指数族里的充分统计量
4.8 例:正态均值 (已知 )
所以
而
4.9 例:估计
可算得
由链式法则 CRLB(
两者之差为
这是一个重要认识:UMVUE ⊋ 有效估计(UMVUE 只保证方差在所有无偏估计中最小,但不一定等于 CRLB)。
5. 复习梳理:本章知识体系图
参数估计
|
┌─────────────┼─────────────┐
| | |
点估计 区间估计 估计量评价
| | |
┌─────┼─────┐ 正态/二项CI 无偏性
MLE MoM 顺序统计量 误差范围 有效性
(定义域含θ) 样本量 |
Fisher 信息
|
Cramér-Rao 下界
|
有效估计 / UMVUE6. 常见错误与考点提示
| 误区 | 正确认识 |
|---|---|
| 样本方差分母用 | 无偏需用 |
| MLE 一定无偏 | 不一定!比如 |
| CI 里有 95% 的概率含真值 | 95% 是方法的重复覆盖率, |
| 定义域含参数的 MLE 仍求导 | 要直接看似然函数的单调性,MLE 往往是顺序统计量 |
| CRLB 一定能达到 | 只有指数族自然参数的充分统计量可以,其他情况不一定 |
| Margin of Error 取决于 | 只取决于 |
7. 关键公式速查表
| 内容 | 公式 |
|---|---|
| 似然函数 | |
| 对数似然 | |
| Poisson MLE | |
| Normal MLE | |
| 样本方差(无偏) | |
| Normal 均值 CI | |
| Binomial | |
| Margin of Error (95%) | |
| 样本量 | |
| Fisher 信息 | |
| Cramér–Rao 下界 | |
| 无偏估计 CRLB |
8. 学习建议
- 先理解直觉再看公式:MLE 就是"反向推理——哪种参数值最可能产生这组数据"。
- 推导走一遍:别只记结论。Poisson、Normal、Uniform 的 MLE 都亲手推一遍。
- MoM vs MLE:MoM 简单但不一定有效;MLE 通常更优(大样本下是渐近最优的)。
- CI 理解要准:95% 是方法属性,不是
的属性。 - Fisher 信息是一级难点:记住两种等价定义(一阶得分的方差 / 二阶负期望),指数族里方差直接等于
或 。 - CRLB 是理论上限:不是所有无偏估计都能达到;达到的叫"有效估计"。
完成这些思路的梳理之后,建议把本章中的每个 Case Study / Example 都自己从头算一遍,尤其是:
- Poisson 的 MLE(第 9 页)
- Normal 双参数 MLE(第 20 页)
- Gamma 的 MoM(第 26 页)
- Binomial 的 CI(第 35–38 页)
- 样本方差无偏化(第 59 页)
- CRLB 证明(第 72 页)
- 指数族 CRLB 达到(第 73 页)
祝学习顺利!
9. 专题补充:MLE 的技术细节与边界问题
MLE 的例题不只是“求导令零”。真正要掌握的是:似然函数、支持集、边界、约束和参数化都会影响答案。
9.1 MLE 标准流程
对样本
常用步骤是:
- 写出 likelihood,不能漏掉参数相关的支持集;
- 取 log-likelihood:
- 求 score:
- 解
; - 检查二阶导、边界和参数空间;
- 给出最终 MLE。
若参数是向量
9.2 支持集依赖参数时,不能只求导
Uniform
在允许的区域
这里若直接求导,会发现没有内部临界点。正确答案来自边界。
类似地,Uniform
9.3 MLE 的不变性
若
则在适当条件下
是
例子:若
注意:MLE 的不变性不等于无偏性保留。
9.4 Normal 双参数 MLE 的细节
若
log-likelihood 为
对
代回或同时对
这不是无偏样本方差。无偏样本方差是
MLE 追求最大似然,不自动追求无偏。
10. 专题补充:CI、Margin of Error 与样本量
10.1 区间估计的 pivot 思路
置信区间常从 pivot 开始。pivot 是一个分布不依赖未知参数的随机量。
例如已知
从
反解
未知
10.2 Margin of Error
对均值区间
半宽为
若希望误差不超过
对比例
若没有先验估计,使用最保守的
得到
95% 区间下
10.3 区间解释的标准表述
正确表述:
使用这种方法重复抽样构造区间,长期来看约有 95% 的区间包含真实参数。
不严谨表述:
这个具体区间以 95% 的概率包含真实参数。
在频率派框架中,参数是固定的,随机的是区间构造过程。
11. 专题补充:Fisher 信息与 CRLB 串联
11.1 Score 的均值为 0
score 定义为
在正则条件下,
这来自
对
11.2 Fisher 信息的两个表达
Fisher 信息为
在正则条件下,也可写为
样本独立时,信息量相加:
这解释了为什么估计精度通常随
11.3 Cramer-Rao 下界
若
若
达到下界的无偏估计量称为有效估计量。
11.4 CRLB 与 MLE 的关系
CRLB 是有限样本下对无偏估计量方差的下界;MLE 则通常有大样本性质:
所以 MLE 常说“渐近有效”,即大样本下达到 CRLB 对应的效率。
12. 本章复习清单
| 核心内容 | 复习时要能做到 |
|---|---|
| likelihood | 会写联合似然并保留支持集 |
| log-likelihood | 会取对数简化乘积 |
| score equation | 会求导并检查最大值 |
| 边界 MLE | 知道 Uniform 类题不能只求导 |
| MLE 不变性 | 会把 |
| Normal MLE | 区分 MLE 方差和无偏样本方差 |
| pivot | 会从分布不含未知参数的量反解 CI |
| margin of error | 会由半宽反推样本量 |
| Fisher 信息 | 会使用一阶和二阶表达 |
| CRLB | 会判断无偏估计方差是否达到下界 |
| 渐近有效 | 能解释 MLE 与 CRLB 的大样本关系 |
13. 综合深化:估计量比较、样本量与预测区间
13.1 同为无偏估计,方差可以相差很大
设
它们的方差分别是
若把
13.2 偏差—方差分解
评价估计量时不应只看无偏性。平方损失下
一个略有偏差但方差显著更小的估计量,可能拥有更小的 MSE。后续的收缩估计与正则化正是利用这一权衡。
13.3 由精度要求反推样本量
总体比例的正态近似置信区间半宽约为
若设计阶段不知道
并向上取整。若已有可靠的先导估计,可用该估计替代
13.4 三类区间不要混淆
- 参数置信区间:覆盖固定但未知的参数,如总体均值。
- 均值响应区间:估计给定协变量处的条件均值,包含参数估计误差。
- 个体预测区间:还要加入新个体自身的随机误差,通常更宽。
共形预测进一步提供有限样本的边际覆盖保证;但边际覆盖不等于对每个协变量取值都满足同样的条件覆盖率。
13.5 正则条件为什么重要
经典 MLE 渐近正态理论通常要求参数不位于边界、支持集不随参数变化、似然足够光滑且 Fisher 信息非退化。