Skip to content

第 9 章:假设检验(Hypothesis Testing)

这一章从“估计参数是多少”转向“根据数据作决策”:在概率控制下,选择拒绝或不拒绝一个统计假设。


0. 本章定位

前两章参数估计回答:

θ 大概是多少?

假设检验回答:

数据是否足以反驳某个默认说法 H0

知识链条:

原假设 H0 / 备择假设 H1
        -> 检验统计量
        -> 拒绝域 / 临界值
        -> 显著性水平 α
        -> p-value
        -> Type I / Type II error
        -> 功效 power
        -> GLRT / 渐近检验

1. 假设检验的基本语言

1.1 原假设与备择假设

  • 原假设 H0:默认立场,通常代表“无效”“无差异”“参数等于某个值”。
  • 备择假设 H1:研究者希望发现的方向,代表“有效”“有差异”“参数偏离某个值”。

例:汽油添加剂是否提高油耗。

H0:μ=25.0H1:μ>25.0

其中 H1 是右侧单边备择。

1.2 决策只有两种

检验最后只做两类决策:

  1. 拒绝 H0
  2. 不拒绝 H0

注意:不拒绝 H0 不等于证明 H0 为真,只是说数据还不足以反驳它。


2. 拒绝域、临界值与显著性水平

2.1 检验统计量

检验统计量是从样本中算出的量,用于衡量数据和 H0 的冲突程度。

例如正态均值、方差已知时:

Z=Y¯μ0σ/n

H0:μ=μ0 为真时:

ZN(0,1)

2.2 拒绝域

拒绝域 C 是检验统计量落入时拒绝 H0 的区域。

例如右尾检验:

C={Zzα}

2.3 显著性水平

显著性水平 αH0 为真时误拒 H0 的概率:

α=P(Reject H0H0 true)

也称检验的 size。

常见取值:0.10、0.05、0.01。


3. 单边与双边检验

3.1 右尾检验

检验

H0:μ=μ0,H1:μ>μ0

拒绝域:

Zzα

3.2 左尾检验

检验

H0:μ=μ0,H1:μ<μ0

拒绝域:

Zzα

3.3 双边检验

检验

H0:μ=μ0,H1:μμ0

拒绝域:

|Z|zα/2

双边检验把显著性水平分到两个尾部。


4. p-value

4.1 定义

p-value 是:在 H0 为真时,观察到当前这么极端或更极端统计量的概率。

直觉:

p-value 越小
  -> 当前数据在 H0 下越罕见
  -> 越有理由拒绝 H0

4.2 决策规则

给定显著性水平 α

p-valueαReject H0

否则不拒绝。

4.3 双边 p-value

若观测到 zobs,双边检验:

p=2P(Z|zobs|)

例如 zobs=0.60

p=P(Z0.60)+P(Z0.60)

5. 二项数据检验:H0:p=p0

5.1 精确检验

XBinomial(n,p)

检验

H0:p=p0

则在 H0 下:

XBinomial(n,p0)

根据备择方向选择尾部概率:

  • H1:p>p0:大 X 支持备择;
  • H1:p<p0:小 X 支持备择;
  • H1:pp0:两端都极端。

5.2 正态近似

n 大时:

Z=p^p0p0(1p0)/nN(0,1)

其中 p^=X/n


6. Type I / Type II error 与功效

6.1 两类错误

决策真实 H0 成立真实 H0 不成立
拒绝 H0Type I error正确拒绝
不拒绝 H0正确不拒绝Type II error

Type I error:

α=P(Reject H0H0 true)

Type II error:

β(θ)=P(Fail to reject H0θH1)

6.2 功效函数

功效:

Power(θ)=1β(θ)

它表示当备择为真时,检验能发现差异的概率。

6.3 取舍

在样本量固定时,通常:

  • 降低 α 会提高 β
  • 提高功效需要更大样本量、更强效应或更小噪声。

7. 广义似然比检验(GLRT)

7.1 核心思想

比较两件事:

  1. H0 限制下,数据最大可能有多大;
  2. 在完整参数空间下,数据最大可能有多大。

H0 下的最大似然远小于总体最大似然,则数据不支持 H0

7.2 定义

设参数空间为 Θ,原假设对应 Θ0Θ。似然为 L(θ)

广义似然比:

λ=supθΘ0L(θ)supθΘL(θ)

由于 Θ0Θ,所以

0λ1

7.3 检验规则

GLRT 在 λ 足够小时拒绝 H0

λcReject H0

常用等价形式:

2logλ

它在许多正则条件下具有渐近 χ2 分布。


8. 渐近检验

当精确分布复杂或样本量大时,使用渐近检验。

8.1 渐近显著性水平

若检验序列 Tn 满足:

lim supnαTn(P)α,PP0

则称 α 是渐近显著性水平。

8.2 一致检验

若在备择下 Type II error 趋于 0,则检验一致:

βn(P)0,PP1

直觉:样本量足够大时,真有差异就几乎一定能发现。


9. 本章知识图谱

                         假设检验
                             |
        ┌────────────────────┼────────────────────┐
        |                    |                    |
     决策框架              错误控制              构造方法
        |                    |                    |
 H0 / H1 / 统计量        Type I α               Z 检验
        |                    |                    |
 拒绝域 / 临界值         Type II β              二项检验
        |                    |                    |
 p-value                 Power=1-β              GLRT
        |                    |                    |
 单边 / 双边             样本量影响             渐近检验

10. 易错点与考点

误区正确认识
不拒绝 H0 就证明 H0 成立只能说证据不足
p-value 是 H0 为真的概率p-value 是在 H0 为真时数据更极端的概率
α 是犯错总概率α 只控制 Type I error
双边检验用 zα双边要用 zα/2
功效越大越容易犯 Type I errorα 固定时,功效通过样本量和检验设计提高
GLRT 比值越大越拒绝比值越小越拒绝

11. 关键公式速查表

内容公式
z 统计量Z=(Y¯μ0)/(σ/n)
右尾拒绝域Zzα
左尾拒绝域Zzα
双尾拒绝域$
二项近似 z(p^p0)/p0(1p0)/n
Type I errorα=P(Reject H0H0)
Type II errorβ=P(Fail to reject H0H1)
功效1β
GLRλ=supΘ0L/supΘL

12. 学习建议

  1. 先写清 H0,H1,尤其备择方向。
  2. 再判断检验统计量在 H0 下的分布。
  3. 单边看一个尾,双边看两个尾。
  4. p-value 的解释要严格:它不是“原假设概率”。
  5. Type II error 和 power 一定是在具体备择参数值下计算。
  6. GLRT 的套路是“受限最大似然 / 无受限最大似然”。

13. 专题深化:假设检验的决策结构

假设检验不是“算一个统计量然后看显著不显著”,而是一个完整的决策规则:

  1. 建立原假设 H0 和备择假设 H1
  2. 选择检验统计量 T(Y)
  3. H0 下确定 T 的分布;
  4. 给定显著性水平 α
  5. 构造拒绝域;
  6. 根据样本落入拒绝域与否作决定。

13.1 原假设与备择假设的角色

通常 H0 是“默认状态”或“没有差异”的命题,例如

H0:μ=μ0.

备择假设表示研究者想寻找的方向:

研究问题备择
是否变大H1:μ>μ0
是否变小H1:μ<μ0
是否不同H1:μμ0

备择方向决定拒绝域在哪个尾部。

13.2 已知方差正态均值 z 检验

Y1,,YnN(μ,σ2),

σ 已知。检验

H0:μ=μ0.

H0 下,

Z=Y¯μ0σ/nN(0,1).

H1:μ>μ0,

拒绝域为

Zzα.

H1:μ<μ0,

拒绝域为

Zzα.

H1:μμ0,

拒绝域为

|Z|zα/2.

13.3 以汽油里程类例题理解拒绝域

常见场景是:厂家声称平均油耗或里程达到某个标准,研究者抽样验证。

如果目标是质疑“平均里程至少 μ0”,则可写

H0:μμ0,H1:μ<μ0.

实际计算时常用边界点 μ=μ0 构造统计量:

Z=Y¯μ0σ/n.

若样本均值显著偏小,即 Z 落入左尾,则拒绝 H0

要点是:检验方向由实际问题决定,不是由样本均值事后决定。


14. 专题深化:p-value、二项检验与正态近似

14.1 p-value 的严格含义

p-value 是在 H0 成立时,观察到当前样本这么极端或更极端的概率。

右尾检验:

p-value=PH0(Zzobs).

左尾检验:

p-value=PH0(Zzobs).

双尾检验:

p-value=PH0(|Z||zobs|).

它不是 P(H0data),也不是“原假设为真的概率”。

14.2 p-value 与拒绝域等价

在固定 α 下:

p-valueα拒绝 H0.

但 p-value 给出的是更细的证据强度。例如 p=0.049p=0.0001 都在 5% 水平拒绝,但证据强度不同。

14.3 精确二项检验

XBin(n,p),

检验

H0:p=p0.

右尾备择 H1:p>p0 的 p-value 为

Pp0(Xxobs).

左尾备择 H1:p<p0 的 p-value 为

Pp0(Xxobs).

双尾二项检验的“更极端”定义略复杂,课程中若未特别强调,常以软件输出或对称近似处理。

14.4 二项检验的正态近似

n 较大时,

p^=Xn

H0:p=p0 下近似满足

p^p0p0(1p0)/nN(0,1).

注意分母使用 p0,因为检验统计量的 null distribution 必须在 H0 下计算。


15. 专题深化:Type I、Type II、Power 与样本量

15.1 两类错误

真实情况决策:不拒绝 H0决策:拒绝 H0
H0正确Type I error
H1Type II error正确

显著性水平

α=P(Reject H0H0 true)

控制的是第一类错误。

第二类错误

β(θ)=Pθ(Fail to reject H0)

依赖具体备择参数 θ

功效函数为

π(θ)=1β(θ)=Pθ(Reject H0).

15.2 z 检验中的 Type II error

检验

H0:μ=μ0,H1:μ>μ0.

拒绝域为

Y¯μ0+zασn.

若真实均值为 μa>μ0,则 Type II error 是

β(μa)=Pμa(Y¯<μ0+zασn).

标准化:

β(μa)=Φ(μ0μaσ/n+zα).

所以功效为

1β(μa).

15.3 样本量如何影响功效

n 增大时,

μaμ0σ/n

增大,备择分布与原假设分布分离得更明显,功效上升。

提高功效的方式:

  1. 增大样本量;
  2. 降低噪声 σ
  3. 使用更有针对性的单侧检验;
  4. 接受更大的 α,但这会增加 Type I error。

15.4 样本量公式的典型形态

右尾 z 检验中,如果希望在 μa 处达到功效 1β,则需要

n[(zα+zβ)σμaμ0]2.

这里 zβ 满足 Φ(zβ)=1β 的具体写法会随教材记号略有不同,复习时重点是理解:

nσ2(μaμ0)2.

效应越小,所需样本量按平方速度增加。


16. 专题深化:广义似然比检验 GLRT

GLRT 用来处理没有简单 z/t 统计量的检验问题。

设参数空间为 Θ,原假设对应子空间 Θ0。广义似然比为

λ(y)=supθΘ0L(θ;y)supθΘL(θ;y).

因为 Θ0Θ,所以

0λ(y)1.

λ(y) 越小,说明原假设下能达到的最大似然远低于不受限制时的最大似然,越倾向拒绝 H0

16.1 GLRT 的计算模板

  1. 写出全参数空间 Θ 下的 MLE;
  2. 写出原假设限制 Θ0 下的 constrained MLE;
  3. 分别代入似然;
  4. 计算比值 λ
  5. λ 化成更直观的统计量;
  6. 找临界值或使用渐近分布。

16.2 Uniform 上界例题的思路

若样本来自

Uniform(0,θ),

似然为

L(θ)=θnI(θy(n)).

全空间 MLE 是

θ^=y(n).

检验形如

H0:θθ0

时,受限最大似然要看 y(n) 是否已经超过 θ0。这类题的核心不是求导,而是处理支持集约束。

16.3 Wilks 定理的直觉

在正则条件下,

2logλ(Y)dχr2,

其中 r 是原假设限制掉的参数维数。

直觉是:大样本下 log-likelihood 在 MLE 附近近似二次型,限制参数会造成一个平方距离损失,因此出现卡方极限。


17. 本章复习清单

核心内容复习时要能做到
假设设定会根据问题写 H0,H1 和备择方向
z 检验会推 null distribution 和拒绝域
单侧/双侧能正确放置临界值
p-value能写出 tail probability,避免误解为 P(H0data)
二项检验会区分精确检验和正态近似
Type I error知道由 α 控制
Type II error会在具体备择值下计算
Power知道功效随效应和样本量增加而上升
样本量会解释 nσ2、效应平方的关系
GLRT会写受限最大似然 / 无受限最大似然
Wilks 定理知道 2logλ 的卡方近似来源

18. 综合深化:FDR、功效曲线与充分统计量检验

18.1 从单次错误率到错误发现率

同时检验许多假设时,即使每次检验的显著性水平都是 α,出现至少一个假阳性的概率也会迅速增大。设 R 为拒绝总数、V 为其中错误拒绝数,错误发现率定义为

FDR=E[VR1].

Benjamini--Hochberg 方法把 m 个 p-value 排序为 p(1)p(m),寻找最大的 k 使

p(k)kmq,

然后拒绝前 k 个假设。在独立等常见条件下,它把 FDR 控制在目标水平 q 附近。它控制的是“发现中的错误比例”,与控制“至少一次错误”的 Bonferroni 方法目标不同。

18.2 功效曲线是备择参数的函数

对已知方差的右侧 z 检验,拒绝域为

X¯>μ0+z1ασn.

当真实均值为 μ 时,功效函数为

π(μ)=1Φ(z1αn(μμ0)σ).

它清楚展示了四个因素:效应越大、样本量越大或噪声越小,功效越高;把 α 取得更小则会降低功效。

18.3 利用充分统计量构造精确检验

XiUnif(0,θ),检验 H0:θ=θ0H1:θ>θ0,自然统计量是 X(n)。因为

Pθ0(X(n)c)=(cθ0)n,

水平为 α 的右尾拒绝域可写为

X(n)>θ0(1α)1/n.

XiPoisson(λ),则 T=iXiPoisson(nλ)。于是关于 λ 的单侧检验可以直接用 T 的精确尾概率,而不必先做正态近似。

18.4 一致性与误差指数

一个检验序列若对每个固定备择参数都有功效趋于 1,就称为一致检验。大偏差理论进一步研究错误概率以多快速度衰减;Chernoff 型界通常呈现

P(错误)enC,

其中 C 衡量两个分布的可分离程度。样本量带来的不仅是“更高功效”,往往还是指数级的错误概率下降。

18.5 完整报告不止一个 p-value

有信息量的检验报告至少应同时给出:效应估计、标准误或置信区间、检验方向与 p-value、样本量,以及模型假设和可能的多重比较调整。p-value 描述零假设下数据有多极端,不等于效应大小、实际重要性或零假设为真的概率。