Appearance
第 4 章 双样本检验(2-Sample Test)
对应课件
4 2-Sample Test.pdf,覆盖 Rosner 第 8 章。 本章把单样本检验拓展到"两个总体的比较"。关键分歧:两组数据是配对还是独立?两类不同设计对应不同的检验方法。
1. 比较两个总体的两种思路
| 设计 | 配对(Paired) | 不配对/独立(Unpaired) |
|---|---|---|
| 含义 | 两次观测来自同一个体或配对的两人 | 两组样本相互独立 |
| 例 | 节食前后的体重;同年龄+同 BMI 配对个体一吃一不吃 | 一组吃,一组不吃,互不相关 |
| 设计 | 纵向(Longitudinal) 或 配对(Matched Pairs) | 横断面(Cross-sectional) |
| 检验 | Paired t-test(→ 转化为单样本 t) | Two-sample t-test(独立) |
核心思想:能不能"成对取差",决定了是 Paired 还是 Unpaired。
1.1 纵向研究(Longitudinal)举例
研究新饮食对体重的影响:
- 测量基线体重
- 一段时间后筛出严格执行饮食的人
- 测量随访体重
- 比较 baseline vs follow-up
→ 同一批人前后两次测量 = 配对数据
1.2 横断面研究(Cross-sectional)举例
- 同一时刻测:吃饮食组 vs 没吃饮食组的体重
- 两组不同个体
- → 独立数据
但研究者通常会按重要协变量平衡两组(年龄、性别、BMI、活动水平),减少混杂。
2. 配对 t 检验(Paired t-test)
2.1 模型设定
第
注意每对都有自己的
→ 各对的"个体效应"
2.2 检验流程
其中
决策规则:
双侧 p 值:
2.3 配对设计的优势
- 每个个体作自己的对照,把"个体差异"全部消掉
- 比起独立设计,功效更高(在效应一定时所需样本量更小)
实际困难:
- 长期跟踪个体的留存率难
- 部分研究无法随机分配(伦理/可行性)
- 找到匹配良好的"双胞胎"对很难
- 实际中常常只能拿到横断面数据
3. 独立两样本 t 检验(Unpaired t-test)
3.1 模型与假设
设两组独立,关键问题:两组方差是否相等?
3.2 假设方差相等:合并方差 t 检验(Pooled-variance t-test)
若
合并方差(Pooled Variance):
检验统计量:
决策:
95% CI 公式:
例:高/低蛋白饮食对大鼠体重
- 高蛋白:
- 低蛋白:
95% CI:
3.3 用 Unpaired 替代 Paired 的代价
设
| Paired | Unpaired | |
|---|---|---|
| 分子 | ||
| 分母 |
如果两次观测高度正相关,
结论:配对数据必须用 paired t-test! 否则会损失功效(增加第二类错误)。
4. 方差相等吗?F 检验(F-test for Variances)
4.1 为什么要检验?
两样本 t 检验的合并方差公式前提是方差相等。如果违反 → 自由度、统计量分布全错。
4.2 F 分布与统计量
F 分布是两个独立
双侧拒绝域:
双侧 p 值:
: :
F 分布关键性质:
,可用此从单边表查双边临界值。
例:两药降压方差比较
- A 药:
- B 药:
临界值(
0.277 < 1.93 < 3.52 → 不拒绝,方差差异不显著。
5. 方差不等:Welch t 检验
5.1 总流程
- 用 F 检验比较
和 - 不拒绝 → 用 合并方差 t 检验
- 拒绝 → 用 Welch(Satterthwaite)t 检验
现代实践(包括 R 默认
t.test)通常直接使用 Welch,因为它在方差相等时也几乎不损失功效,更稳健。
5.2 Welch t 统计量
Satterthwaite 近似自由度:
注意:
通常不是整数,实践中向下取整保守一些。
例:父亲心脏病史与孩子胆固醇
- 病史组:
- 对照组:
Step 1:方差检验:
临界值
Step 2:Welch t:
结论:父亲死于心脏病的孩子,胆固醇水平显著更高。
6. 样本量与功效(Comparison of Two Means)
6.1 等样本量情形
功效(设
反解 n(双侧):
6.2 不等样本量( )
单侧检验:把
例:糖尿病与非糖尿病收缩压比较
(糖尿病) (非糖尿病) - 双侧
, ,预期 ( )
→ 共需 51 名糖尿病患者 + 102 名非糖尿病者。
7. 检验流程速查表(决策树)
两组数据
├─ 配对/匹配?
│ ├─ 是 → Paired t-test(先取差,再做单样本 t)
│ └─ 否 ↓
│
├─ 独立两组
│ ├─ Step 1: F-test 比较方差
│ │
│ ├─ 方差相等 → Pooled-variance t-test
│ └─ 方差不等 → Welch t-test(Satterthwaite df)
│
└─ 两组均值差的 95% CI 同步给出8. 自测要点(Checklist)
配对数据
- [ ] Paired vs Unpaired 的判定标准
- [ ] 为什么 Paired t-test 等价于"差值的单样本 t"
- [ ] Paired 设计的功效优势从何而来(消除个体效应)
- [ ] 把配对当独立处理的危害
独立两样本
- [ ] 合并方差公式的加权来源(按自由度加权)
- [ ] 合并 t 检验的自由度
- [ ] F 检验的非对称性,双侧拒绝域如何取
- [ ] Welch t 统计量与 Satterthwaite 自由度公式
- [ ] 现代默认为何首选 Welch
样本量与功效
- [ ] 双样本
公式的来源 - [ ] 不等样本量情形下两组人数的非对称
- [ ] 单/双侧、是否对称对样本量的影响
思考题
- RCT 中如果"在每对受试者内部随机分配 A/B",得到的数据是配对还是独立?
, , 。先做 F、再做 t,结果会怎样? - 经费有限时,"两组各 50 人"和"配对设计 50 对"哪个更划算?
- 大样本下 Welch、Pooled、z 三种检验在结果上有差异吗?为什么?