Skip to content

第 4 章 双样本检验(2-Sample Test)

对应课件 4 2-Sample Test.pdf,覆盖 Rosner 第 8 章。 本章把单样本检验拓展到"两个总体的比较"。关键分歧:两组数据是配对还是独立?两类不同设计对应不同的检验方法。


1. 比较两个总体的两种思路

设计配对(Paired)不配对/独立(Unpaired)
含义两次观测来自同一个体配对的两人两组样本相互独立
节食前后的体重;同年龄+同 BMI 配对个体一吃一不吃一组吃,一组不吃,互不相关
设计纵向(Longitudinal)配对(Matched Pairs)横断面(Cross-sectional)
检验Paired t-test(→ 转化为单样本 t)Two-sample t-test(独立)

核心思想:能不能"成对取差",决定了是 Paired 还是 Unpaired。


1.1 纵向研究(Longitudinal)举例

研究新饮食对体重的影响:

  1. 测量基线体重
  2. 一段时间后筛出严格执行饮食的人
  3. 测量随访体重
  4. 比较 baseline vs follow-up

→ 同一批人前后两次测量 = 配对数据


1.2 横断面研究(Cross-sectional)举例

  • 同一时刻测:吃饮食组 vs 没吃饮食组的体重
  • 两组不同个体
  • 独立数据

但研究者通常会按重要协变量平衡两组(年龄、性别、BMI、活动水平),减少混杂。


2. 配对 t 检验(Paired t-test)

2.1 模型设定

i 对的两次观测:

X1iN(μi,σ2),X2iN(μi+Δ,σ2)

注意每对都有自己的 μi。但取差值

di=X2iX1iN(Δ,σd2)

→ 各对的"个体效应" μi 被消掉di 之间独立同分布。问题转化为单样本 t 检验


2.2 检验流程

H0:Δ=0vsH1:Δ0t=d¯0Sd/ntn1

其中 d¯=1ndi=Δ^Sd2=1n1(did¯)2

决策规则|t|>tn1,1α/2 → 拒绝 H0

双侧 p 值

p=2P(Tn1>|t|)

2.3 配对设计的优势

  • 每个个体作自己的对照,把"个体差异"全部消掉
  • 比起独立设计,功效更高(在效应一定时所需样本量更小)

实际困难

  1. 长期跟踪个体的留存率难
  2. 部分研究无法随机分配(伦理/可行性)
  3. 找到匹配良好的"双胞胎"对很难
  4. 实际中常常只能拿到横断面数据

3. 独立两样本 t 检验(Unpaired t-test)

3.1 模型与假设

X1N(μ1,σ12),X2N(μ2,σ22)H0:μ1=μ2vsH1:μ1μ2

设两组独立,关键问题:两组方差是否相等?


3.2 假设方差相等:合并方差 t 检验(Pooled-variance t-test)

σ12=σ22=σ2

X¯1X¯2N(μ1μ2,σ2(1n1+1n2))

合并方差(Pooled Variance):

Sp2=(n11)S12+(n21)S22n1+n22

检验统计量

t=X¯1X¯2Sp1/n1+1/n2tn1+n22

决策|t|>tn1+n22,1α/2 → 拒绝 H0

95% CI 公式

(X¯1X¯2)±tn1+n22,1α/2Sp1n1+1n2

例:高/低蛋白饮食对大鼠体重

  • 高蛋白:n1=12,X¯1=120,S12=457.45
  • 低蛋白:n2=7,X¯2=101,S22=425.33
Sp2=11(457.45)+6(425.33)17=446.18,Sp112+17=10.04t=(120101)/10.04=1.89,p0.0757

t17,0.975=2.110,1.89 < 2.110,不拒绝 H0

95% CI19.0±2.11010.04=(2.2,40.2),包含 0,与 p 值结论一致。


3.3 用 Unpaired 替代 Paired 的代价

X1i,X2i 来自同一对(实为配对),却用 unpaired 检验:

PairedUnpaired
分子d¯d¯(一样)
分母Sd/n2Sp/n

如果两次观测高度正相关,Sd 远小于 2Sppaired 的 t 值更大、p 更小、功效更高

结论配对数据必须用 paired t-test! 否则会损失功效(增加第二类错误)。


4. 方差相等吗?F 检验(F-test for Variances)

4.1 为什么要检验?

两样本 t 检验的合并方差公式前提是方差相等。如果违反 → 自由度、统计量分布全错。


4.2 F 分布与统计量

F 分布是两个独立 χ2 分布之比的分布,右偏、不对称,分子 d1、分母 d2 两个自由度。

F=S12S22Fn11,n21(在 H0 下)

双侧拒绝域

F<Fn11,n21,α/2F>Fn11,n21,1α/2

双侧 p 值

  • F1p=2P(Fn11,n21>F)
  • F<1p=2P(Fn11,n21<F)

F 分布关键性质:Fd1,d2,p=1/Fd2,d1,1p,可用此从单边表查双边临界值。


例:两药降压方差比较

  • A 药:n=12,SA2=15.8
  • B 药:n=10,SB2=8.2

F=15.8/8.2=1.93df1=11,df2=9

临界值(α=0.05):F11,9,0.025=0.277,F11,9,0.975=3.52

0.277 < 1.93 < 3.52 → 不拒绝,方差差异不显著。


5. 方差不等:Welch t 检验

5.1 总流程

  1. 用 F 检验比较 σ12σ22
  2. 不拒绝 → 用 合并方差 t 检验
  3. 拒绝 → 用 Welch(Satterthwaite)t 检验

现代实践(包括 R 默认 t.test)通常直接使用 Welch,因为它在方差相等时也几乎不损失功效,更稳健。


5.2 Welch t 统计量

t=X¯1X¯2S12n1+S22n2

Satterthwaite 近似自由度

d=(S12n1+S22n2)2(S12/n1)2n11+(S22/n2)2n21

注意d 通常不是整数,实践中向下取整保守一些。


例:父亲心脏病史与孩子胆固醇

  • 病史组:n1=100,x¯1=207.3,s1=35.6
  • 对照组:n2=74,x¯2=193.4,s2=17.3

Step 1:方差检验F=35.62/17.32=4.23

临界值 F99,73,0.9751.549,4.23 > 1.549 → 拒绝 → 方差不等

Step 2:Welch t

t=207.3193.435.62/100+17.32/74=3.40d151

t151,0.975=1.976,3.40 > 1.976 → 拒绝 H0

结论:父亲死于心脏病的孩子,胆固醇水平显著更高。


6. 样本量与功效(Comparison of Two Means)

6.1 等样本量情形

Z=X¯1X¯2σ12/n+σ22/nN(0,1)(H0)

功效(设 Δ=μ1μ2>0):

Power=1Φ(z1α/2Δ(σ12+σ22)/n)

反解 n(双侧):

n=(σ12+σ22)(z1α/2+z1β)2Δ2

6.2 不等样本量(n2=kn1

n1=(σ12+σ22/k)(z1α/2+z1β)2Δ2,n2=(kσ12+σ22)(z1α/2+z1β)2Δ2

单侧检验:把 z1α/2 换成 z1α


例:糖尿病与非糖尿病收缩压比较

  • μ1=140.5,σ1=18.2(糖尿病)
  • μ2=132.1,σ2=15.7(非糖尿病)
  • 双侧 α=0.051β=0.8,预期 n2=2n1k=2
n1=(18.22+15.72/2)(1.96+0.84)2(140.5132.1)2=(331.24+123.245)(7.84)70.5650.551

n2=2×51=102

→ 共需 51 名糖尿病患者 + 102 名非糖尿病者


7. 检验流程速查表(决策树)

两组数据
├─ 配对/匹配?
│   ├─ 是 → Paired t-test(先取差,再做单样本 t)
│   └─ 否 ↓

├─ 独立两组
│   ├─ Step 1: F-test 比较方差
│   │
│   ├─ 方差相等 → Pooled-variance t-test
│   └─ 方差不等 → Welch t-test(Satterthwaite df)

└─ 两组均值差的 95% CI 同步给出

8. 自测要点(Checklist)

配对数据

  • [ ] Paired vs Unpaired 的判定标准
  • [ ] 为什么 Paired t-test 等价于"差值的单样本 t"
  • [ ] Paired 设计的功效优势从何而来(消除个体效应)
  • [ ] 把配对当独立处理的危害

独立两样本

  • [ ] 合并方差公式的加权来源(按自由度加权)
  • [ ] 合并 t 检验的自由度 n1+n22
  • [ ] F 检验的非对称性,双侧拒绝域如何取
  • [ ] Welch t 统计量与 Satterthwaite 自由度公式
  • [ ] 现代默认为何首选 Welch

样本量与功效

  • [ ] 双样本 n 公式的来源
  • [ ] 不等样本量情形下两组人数的非对称
  • [ ] 单/双侧、是否对称对样本量的影响

思考题

  1. RCT 中如果"在每对受试者内部随机分配 A/B",得到的数据是配对还是独立?
  2. n1=10,n2=10s1=10,s2=2X¯1X¯2=5。先做 F、再做 t,结果会怎样?
  3. 经费有限时,"两组各 50 人"和"配对设计 50 对"哪个更划算?
  4. 大样本下 Welch、Pooled、z 三种检验在结果上有差异吗?为什么?