Skip to content

第 5 章 多样本推断(Multisample Inference / ANOVA)

对应课件 5 Multisample inference.pdf,覆盖 Rosner 第 12 章。 本章把双样本均值比较推广到 3:方差分析(ANOVA)。 核心思想:整体差异是否大于组内噪声? → 比"组间方差"和"组内方差"。


1. ANOVA 概览

1.1 ANOVA 解决什么问题?

  • 比较 3 组(连续型结局变量、近似正态、各组方差相等)的均值
  • 双样本 t 检验只能 2 组;多组用 t 一对对比会带来"多重比较"问题
  • ANOVA 一次回答:"是否存在至少一对均值不同?"

核心思想:组间差异(信号)远大于组内噪声 → 拒绝 H0

1.2 历史背景

  • 1918 年 Fisher 在论文中提出"variance"和方差分析
  • 1925 年《Statistical Methods for Research Workers》普及
  • 1950 年代 Tukey、Scheffé 等提出多重比较修正

1.3 三种效应模型

模型含义例子
固定效应(Fixed)处理组由实验者预先指定教材列表里指定 5 本,比较哪本好
随机效应(Random)处理组是随机抽自一个总体随机抽研究生,调查他们用的本科教材
混合效应(Mixed)既有固定也有随机因子性别(固定)+ 实验室(随机)

2. 单因素方差分析(One-way ANOVA, Fixed Effects)

2.1 引例:被动吸烟与肺功能(FEF)

6 组(每组男女各半):

  1. NS(不吸烟无暴露) n=400
  2. PS(被动吸烟) n=400
  3. NI(吸但不吸入) n=100
  4. LS(轻度吸烟,1–10 支/天 ≥20年)n=400
  5. MS(中度,11–39 支/天 ≥20年)n=400
  6. HS(重度,≥40 支/天 ≥20年)n=400

男性数据

nMean FEFSD
NS2003.780.79
PS2003.300.77
NI503.320.86
LS2003.230.78
MS2002.730.81
HS2002.590.82

6 组均值是否显著不同?


2.2 模型

yij=μ+αi+eij,i=1,,k;j=1,,ni
  • μ:总体均值(常数)
  • αi:第 i 组的"效应"(偏离总均值)
  • eijN(0,σ2):随机误差(各组方差相同!
  • yijN(μ+αi,σ2)

约束:参数 k+1{μ,α1,,αk} 但只有 k 个组均值,所以加约束

i=1kαi=0αref=0

2.3 假设

H0:μ1=μ2==μkα1==αk=0H1:至少有一对 μiμj

2.4 平方和分解(核心)

每个观测的总偏离可分两部分:

yijy¯=(yijy¯i)组内+(y¯iy¯)组间

平方求和后交叉项为 0,得:

i,j(yijy¯)2TSS(总)=i,j(yijy¯i)2WSS(组内)+i,j(y¯iy¯)2BSS(组间)

直觉:

  • BSS 大、WSS 小 → 组间差异远超噪声 → 至少一组不同
  • BSS 小、WSS 大 → 信号被噪声淹没

2.5 均方(Mean Squares)

BMS=BSSk1,WMS=WSSnk
  • 组间自由度:k1(k 个均值减一个总均值约束)
  • 组内自由度:nk(每组 ni 个观测减一个组均值)

2.6 F 检验

F=BMSWMSFk1,nk(在 H0 下)

决策F>Fk1,nk,1α → 拒绝 H0

注意:F 检验是右尾检验!因为只有 BMS 远大于 WMS 时才"显著"。

ANOVA 表

来源SSdfMSFp
组间(Between)BSSk1BMSBMS/WMSP(Fk1,nk>F)
组内(Within)WSSnkWMS
总(Total)TSSn1

2.7 例:吸烟数据 ANOVA

计算公式

BSS=niy¯i2ny¯2,WSS=(ni1)si2BSS=184.38,WSS=663.87BMS=184.38/(61)=36.875,WMS=663.87/(10506)=0.636F=36.875/0.636=58.0,F5,1044,0.952.22

F 临界值,p < 0.001,强烈拒绝 H0,至少有一组均值不同。


2.8 方差齐性检验:Bartlett 检验

ANOVA 假设各组方差相等(同方差性 / homoscedasticity)。Bartlett 检验:

H0:σ12==σk2

统计量:

χ2=(nk)lnsp2(ni1)lnsi21+13(k1)(1ni11nk)χk12

其中合并方差 sp2=(ni1)si2nk

χ2>χk1,1α2 即拒绝

警告:Bartlett 对正态性也很敏感;非正态时可改用 Levene 检验(更稳健,但 Rosner 课程主要讲 Bartlett)。


3. ANOVA 显著后做什么?组间多重比较

整体 F 显著只告诉你"至少有一对不同",并不指出哪些

3.1 单一预设比较(Pre-specified)

只关心一个比较时,做 1 次 t 检验即可。

3.2 LSD 方法(Least Significant Difference)

LSD = 用 ANOVA 的合并方差 s2=WMS 替代两样本 t 中的合并方差。

t=y¯iy¯js2(1ni+1nj)tnk

CI:

(y¯iy¯j)±tnk,1α/2s2(1/ni+1/nj)

优势:用了所有组的信息估计 σ2,比仅用两组的合并方差更精确(自由度更大、临界值更小)。

前提:方差相等。


3.3 线性对比(Linear Contrast)

线性对比 L:系数和为 0 的线性组合。

L=i=1kciy¯i,ci=0
  • c=(1,1,0,) → 两组比较
  • c=(1,13,13,13) → 第 1 组 vs 其他三组平均

检验 H0:μL=ciαi=0

t=ciy¯is2ci2/nitnk

例:肺功能对比

L=y¯10.1y¯40.7y¯50.2y¯6

(用 NS 与吸烟人群"加权平均"比较)

L=3.780.1(3.23)0.7(2.73)0.2(2.59)=1.03Var(L)=0.636[1200+0.01200+0.49200+0.04200]=0.00489t=1.03/0.00489=14.69t1044,p<0.001

4. 多重比较问题(Multiple Comparisons)

4.1 问题本质

每个检验有 α 概率犯第一类错误。做 W 个独立检验:

P(至少一次假阳性)=1(1α)W

W=10,α=0.05 → 约 40% 概率"被骗"。

4.2 常见修正方法

方法适用
Bonferroni通用、简单、保守
Tukey HSDANOVA 后所有两两配对
Scheffé任意线性对比
Dunnett多组 vs 单一对照(k−1 次)
FDR (Benjamini–Hochberg)控制错误发现率,功效高

4.3 Bonferroni 修正

k 组所有两两比较共 W=(k2)=k(k1)/2 次。

调整水平

α=α/W

每个比较都用 α 作为显著性水平:

|t|>tnk,1α/2拒绝

理论依据(Bonferroni 不等式):

P(至少一次假阳性)P(每次假阳性)=Wα

Wα=αα=α/W


例:FEF 数据

k=6W=15α=0.05α=0.05/150.0033

t 临界值由 t1044,1α/2 得到 2.94(远大于 LSD 的 1.96)。

比较tLSD(1.96)Bonferroni(2.94)
NS vs PS6.02显著显著
NS vs HS14.92显著显著
NS vs NI3.65显著显著
PS vs LS0.88不显著不显著
MS vs HS1.76不显著不显著

Bonferroni 更保守:减少 Type I 错误,但也可能漏掉真实差异(功效降低)。


4.4 报告方式

方法 1:报告原始 p 值,但说明显著阈值已调到 α

"实验级 α=0.05,5 个比较,调整后 α=0.01;只有 p<0.01 的比较才显著。"

方法 2:报告调整后的 p 值(每个 p 乘以 W),仍按 0.05 判断

"Bonferroni 调整后,padj<0.05 才显著。"


5. 两因素方差分析(Two-way ANOVA)

5.1 为什么不直接用一因素?

可以把"性别 × 饮食"组合成一个 6 水平因子做 one-way,但两因素 ANOVA 能分别评估每个因子的主效应及二者的交互

5.2 模型

yijk=μ+αi+βj+γij+eijk
  • αi:因子 A(如性别)的主效应
  • βj:因子 B(如饮食)的主效应
  • γij:A × B 交互效应
  • eijkN(0,σ2)

约束αi=0βj=0jγij=0iiγij=0j


5.3 三个假设检验

H0A:所有 αi=0H0B:所有 βj=0H0AB:所有 γij=0

5.4 平方和分解

yijky¯..=(yijky¯ij)+(y¯i.y¯..)+(y¯.jy¯..)+(y¯ijy¯i.y¯.j+y¯..)
来源SSdfMSF
ASS(A)a1MS(A)MS(A)/MS(E)
BSS(B)b1MS(B)MS(B)/MS(E)
ABSS(AB)(a1)(b1)MS(AB)MS(AB)/MS(E)
误差SS(E)NabMS(E)
SS(T)N1

5.5 交互的几何含义

模式含义
平行折线无交互
不平行但不相交主效应明显,交互可能
交叉强交互(一个因子的效应方向取决于另一个因子)

交互显著时,不能单独解释主效应——必须分组讨论。


6. 随机效应模型(Random Effects)

6.1 适用场景

  • 关心的不是"组间差异有多大",而是"总变异中有多少来自组间 vs 组内"
  • 例:抽 5 名女性各 2 个血样测雌二醇 → 关注:测量误差 vs 个体差异

6.2 模型

yij=μ+αi+eij

但与固定效应不同:

αiN(0,σα2),eijN(0,σ2),αieij

→ 三个参数:μ,σα2,σ2

观测的边际分布与协方差:

yijN(μ,σ2+σα2)Cov(yij,yij)={σ2+σα2i=i,j=jσα2i=i,jj0ii

→ 同一受试者的两次观测相关


6.3 F 检验

H0:σα2=0vsH1:σα2>0F=BMSWMSFk1,nk(H0)

形式上与固定效应 ANOVA 相同,但含义不同:固定效应检验"均值是否相等";随机效应检验"组间方差是否为 0"。


6.4 方差成分估计

可证明:

E(WMS)=σ2,E(BMS)=σ2+n0σα2

(balanced 设计:每组 n0 次观测)

σ^2=WMS,σ^α2=max(BMSWMSn0,0)

不平衡设计中 n0 替换为:

n0=nini2/nik1

例:护士血浆雌二醇可重复性

5 名受试者,每人 2 个等分样品。对数变换后做随机效应 ANOVA:

来源SSdfMS
组间2.65840.6644
组内0.15050.0300
2.8089
σ^2=0.030,σ^α2=max(0.66440.0302,0)=0.32

个体差异(0.32)远大于测量误差(0.030) → 该指标可重复性较好。

为何要 log 变换?因为原始数据中"差值"随均值增大而增大(不齐性);log 变换后近似齐性。


7. 各种 ANOVA 模型一览

类型模型
One-way ANOVA / 1 fixed单因子,固定
Two-way ANOVA / 2 fixed两因子,均固定
One-way / 1 random随机效应模型
Two-way / 1 fixed + 1 random混合模型(Mixed)

8. 自测要点(Checklist)

单因素 ANOVA

  • [ ] ANOVA 的核心思想:组间 vs 组内
  • [ ] 模型 yij=μ+αi+eij,约束 αi=0
  • [ ] BSS / WSS / TSS 的分解(交叉项为 0)
  • [ ] BMS、WMS、F 的定义与自由度
  • [ ] F 是右尾检验
  • [ ] Bartlett 检验前提与统计量

ANOVA 后比较

  • [ ] LSD vs 标准 t 检验:用合并方差与更大自由度
  • [ ] 线性对比的系数约束 ci=0
  • [ ] 线性对比的方差公式 s2ci2/ni

多重比较

  • [ ] 多重比较为何会膨胀 Type I 错误
  • [ ] Bonferroni α=α/W 的来源
  • [ ] LSD vs Bonferroni 的功效/保守性权衡
  • [ ] Tukey、Scheffé、Dunnett、FDR 各自适用

两因素 ANOVA

  • [ ] 主效应、交互效应的含义
  • [ ] 平方和分解、ANOVA 表
  • [ ] 交互显著时,不能单独解释主效应

随机效应

  • [ ] 固定 vs 随机的根本区别
  • [ ] σ2,σα2 的含义与估计
  • [ ] 同组观测之间的相关结构

思考题

  1. 6 组各 100 人,全局 F 检验显著,紧接着做所有两两 t 检验都不显著,可能吗?为什么?
  2. 双样本 t 检验和 k=2 时的 ANOVA 等价吗?为何 F 平方根 = t 绝对值?
  3. 你做了 100 个独立检验,5 个 p<0.05。是否应"庆祝"?请用 Bonferroni 和 FDR 两种思路评论。
  4. 一个研究"基因 × 处理"在小鼠中的表达,建议用一/二因素 ANOVA?为什么?