Appearance
第 9 章:假设检验(Hypothesis Testing)
这一章从“估计参数是多少”转向“根据数据作决策”:在概率控制下,选择拒绝或不拒绝一个统计假设。
0. 本章定位
前两章参数估计回答:
假设检验回答:
知识链条:
原假设 H0 / 备择假设 H1
-> 检验统计量
-> 拒绝域 / 临界值
-> 显著性水平 α
-> p-value
-> Type I / Type II error
-> 功效 power
-> GLRT / 渐近检验1. 假设检验的基本语言
1.1 原假设与备择假设
- 原假设
:默认立场,通常代表“无效”“无差异”“参数等于某个值”。 - 备择假设
:研究者希望发现的方向,代表“有效”“有差异”“参数偏离某个值”。
例:汽油添加剂是否提高油耗。
其中
1.2 决策只有两种
检验最后只做两类决策:
- 拒绝
; - 不拒绝
。
注意:不拒绝
2. 拒绝域、临界值与显著性水平
2.1 检验统计量
检验统计量是从样本中算出的量,用于衡量数据和
例如正态均值、方差已知时:
在
2.2 拒绝域
拒绝域
例如右尾检验:
2.3 显著性水平
显著性水平
也称检验的 size。
常见取值:0.10、0.05、0.01。
3. 单边与双边检验
3.1 右尾检验
检验
拒绝域:
3.2 左尾检验
检验
拒绝域:
3.3 双边检验
检验
拒绝域:
双边检验把显著性水平分到两个尾部。
4. p-value
4.1 定义
p-value 是:在
直觉:
p-value 越小
-> 当前数据在 H0 下越罕见
-> 越有理由拒绝 H04.2 决策规则
给定显著性水平
否则不拒绝。
4.3 双边 p-value
若观测到
例如
5. 二项数据检验:
5.1 精确检验
若
检验
则在
根据备择方向选择尾部概率:
:大 支持备择; :小 支持备择; :两端都极端。
5.2 正态近似
当
其中
6. Type I / Type II error 与功效
6.1 两类错误
| 决策 | 真实 | 真实 |
|---|---|---|
| 拒绝 | Type I error | 正确拒绝 |
| 不拒绝 | 正确不拒绝 | Type II error |
Type I error:
Type II error:
6.2 功效函数
功效:
它表示当备择为真时,检验能发现差异的概率。
6.3 取舍
在样本量固定时,通常:
- 降低
会提高 ; - 提高功效需要更大样本量、更强效应或更小噪声。
7. 广义似然比检验(GLRT)
7.1 核心思想
比较两件事:
- 在
限制下,数据最大可能有多大; - 在完整参数空间下,数据最大可能有多大。
若
7.2 定义
设参数空间为
广义似然比:
由于
7.3 检验规则
GLRT 在
常用等价形式:
它在许多正则条件下具有渐近
8. 渐近检验
当精确分布复杂或样本量大时,使用渐近检验。
8.1 渐近显著性水平
若检验序列
则称
8.2 一致检验
若在备择下 Type II error 趋于 0,则检验一致:
直觉:样本量足够大时,真有差异就几乎一定能发现。
9. 本章知识图谱
假设检验
|
┌────────────────────┼────────────────────┐
| | |
决策框架 错误控制 构造方法
| | |
H0 / H1 / 统计量 Type I α Z 检验
| | |
拒绝域 / 临界值 Type II β 二项检验
| | |
p-value Power=1-β GLRT
| | |
单边 / 双边 样本量影响 渐近检验10. 易错点与考点
| 误区 | 正确认识 |
|---|---|
| 不拒绝 | 只能说证据不足 |
| p-value 是 | p-value 是在 |
| 双边检验用 | 双边要用 |
| 功效越大越容易犯 Type I error | 在 |
| GLRT 比值越大越拒绝 | 比值越小越拒绝 |
11. 关键公式速查表
| 内容 | 公式 |
|---|---|
| z 统计量 | |
| 右尾拒绝域 | |
| 左尾拒绝域 | |
| 双尾拒绝域 | $ |
| 二项近似 z | |
| Type I error | |
| Type II error | |
| 功效 | |
| GLR |
12. 学习建议
- 先写清
,尤其备择方向。 - 再判断检验统计量在
下的分布。 - 单边看一个尾,双边看两个尾。
- p-value 的解释要严格:它不是“原假设概率”。
- Type II error 和 power 一定是在具体备择参数值下计算。
- GLRT 的套路是“受限最大似然 / 无受限最大似然”。
13. 专题深化:假设检验的决策结构
假设检验不是“算一个统计量然后看显著不显著”,而是一个完整的决策规则:
- 建立原假设
和备择假设 ; - 选择检验统计量
; - 在
下确定 的分布; - 给定显著性水平
; - 构造拒绝域;
- 根据样本落入拒绝域与否作决定。
13.1 原假设与备择假设的角色
通常
备择假设表示研究者想寻找的方向:
| 研究问题 | 备择 |
|---|---|
| 是否变大 | |
| 是否变小 | |
| 是否不同 |
备择方向决定拒绝域在哪个尾部。
13.2 已知方差正态均值 z 检验
设
且
在
若
拒绝域为
若
拒绝域为
若
拒绝域为
13.3 以汽油里程类例题理解拒绝域
常见场景是:厂家声称平均油耗或里程达到某个标准,研究者抽样验证。
如果目标是质疑“平均里程至少
实际计算时常用边界点
若样本均值显著偏小,即
要点是:检验方向由实际问题决定,不是由样本均值事后决定。
14. 专题深化:p-value、二项检验与正态近似
14.1 p-value 的严格含义
p-value 是在
右尾检验:
左尾检验:
双尾检验:
它不是
14.2 p-value 与拒绝域等价
在固定
但 p-value 给出的是更细的证据强度。例如
14.3 精确二项检验
若
检验
右尾备择
左尾备择
双尾二项检验的“更极端”定义略复杂,课程中若未特别强调,常以软件输出或对称近似处理。
14.4 二项检验的正态近似
当
在
注意分母使用
15. 专题深化:Type I、Type II、Power 与样本量
15.1 两类错误
| 真实情况 | 决策:不拒绝 | 决策:拒绝 |
|---|---|---|
| 正确 | Type I error | |
| Type II error | 正确 |
显著性水平
控制的是第一类错误。
第二类错误
依赖具体备择参数
功效函数为
15.2 z 检验中的 Type II error
检验
拒绝域为
若真实均值为
标准化:
所以功效为
15.3 样本量如何影响功效
当
增大,备择分布与原假设分布分离得更明显,功效上升。
提高功效的方式:
- 增大样本量;
- 降低噪声
; - 使用更有针对性的单侧检验;
- 接受更大的
,但这会增加 Type I error。
15.4 样本量公式的典型形态
右尾 z 检验中,如果希望在
这里
效应越小,所需样本量按平方速度增加。
16. 专题深化:广义似然比检验 GLRT
GLRT 用来处理没有简单 z/t 统计量的检验问题。
设参数空间为
因为
16.1 GLRT 的计算模板
- 写出全参数空间
下的 MLE; - 写出原假设限制
下的 constrained MLE; - 分别代入似然;
- 计算比值
; - 将
化成更直观的统计量; - 找临界值或使用渐近分布。
16.2 Uniform 上界例题的思路
若样本来自
似然为
全空间 MLE 是
检验形如
时,受限最大似然要看
16.3 Wilks 定理的直觉
在正则条件下,
其中
直觉是:大样本下 log-likelihood 在 MLE 附近近似二次型,限制参数会造成一个平方距离损失,因此出现卡方极限。
17. 本章复习清单
| 核心内容 | 复习时要能做到 |
|---|---|
| 假设设定 | 会根据问题写 |
| z 检验 | 会推 null distribution 和拒绝域 |
| 单侧/双侧 | 能正确放置临界值 |
| p-value | 能写出 tail probability,避免误解为 |
| 二项检验 | 会区分精确检验和正态近似 |
| Type I error | 知道由 |
| Type II error | 会在具体备择值下计算 |
| Power | 知道功效随效应和样本量增加而上升 |
| 样本量 | 会解释 |
| GLRT | 会写受限最大似然 / 无受限最大似然 |
| Wilks 定理 | 知道 |
18. 综合深化:FDR、功效曲线与充分统计量检验
18.1 从单次错误率到错误发现率
同时检验许多假设时,即使每次检验的显著性水平都是
Benjamini--Hochberg 方法把
然后拒绝前
18.2 功效曲线是备择参数的函数
对已知方差的右侧 z 检验,拒绝域为
当真实均值为
它清楚展示了四个因素:效应越大、样本量越大或噪声越小,功效越高;把
18.3 利用充分统计量构造精确检验
若
水平为
若
18.4 一致性与误差指数
一个检验序列若对每个固定备择参数都有功效趋于 1,就称为一致检验。大偏差理论进一步研究错误概率以多快速度衰减;Chernoff 型界通常呈现
其中
18.5 完整报告不止一个 p-value
有信息量的检验报告至少应同时给出:效应估计、标准误或置信区间、检验方向与 p-value、样本量,以及模型假设和可能的多重比较调整。p-value 描述零假设下数据有多极端,不等于效应大小、实际重要性或零假设为真的概率。