Appearance
第 12 章:双样本推断(Two-Sample Inferences)
本章研究两个总体之间的比较:均值是否相等?方差是否相等?两个比例是否相等?对应的置信区间如何构造?
0. 本章定位
第 10 章解决单个正态总体的均值和方差推断。
第 12 章把问题扩展到两个独立样本:
和
核心对象从单个参数变成参数差或参数比:
1. 两样本均值检验:等方差情形
1.1 模型假设
设两组样本独立:
注意这里假设两组方差相同。
1.2 pooled variance
两个样本方差分别为
这是对共同方差
1.3 两样本 t 统计量
检验
时使用:
1.4 单边与双边
右尾:
左尾:
双尾:
2. Behrens-Fisher 问题:不等方差情形
当
使用 Welch 统计量:
近似服从
实际数据分析中,Welch 两样本
3. 两总体方差比较:F 检验
3.1 基本分布
若两组正态样本独立,则
检验:
统计量:
在
3.2 备择方向
右尾:
拒绝:
左尾:
双尾时两边都要看。
注意:F 检验对正态性很敏感。若数据明显非正态,要谨慎。
4. 两个比例比较:
4.1 数据结构
两组 Bernoulli / Binomial 数据:
检验:
4.2 pooled estimate
在
4.3 z 统计量
根据备择方向选择右尾、左尾或双尾。
5. 两样本均值差的置信区间
5.1 等方差正态情形
若区间不包含 0,与双侧
5.2 不等方差情形
使用 Welch 标准误:
其中
6. 方差比的置信区间
由
可得:
不同教材对
7. 两比例差的置信区间
置信区间不使用
检验时 pooled,区间时 unpooled,这是常见考点。
8. 本章知识图谱
双样本推断
|
┌────────────────────┼────────────────────┐
| | |
均值比较 方差比较 比例比较
| | |
等方差 -> pooled t F test pooled z test
| | |
不等方差 -> Welch t 方差比CI p_X-p_Y CI
|
μ_X-μ_Y CI
|
paired? -> 不属于独立双样本,回到差值的一样本 t9. 易错点与考点
| 误区 | 正确认识 |
|---|---|
| 两组数据一定独立 | 配对数据不能用本章独立两样本公式 |
| 方差不等也用 pooled t | 应使用 Welch t 检验 |
| 两比例 CI 使用 pooled 比例 | 检验用 pooled,CI 通常用各自比例 |
| F 检验不要求正态 | F 检验强依赖正态性 |
| 两样本 t 自由度是 | 等方差情形是 |
| CI 包含 0 还能双侧拒绝 | 同一设定下,包含 0 通常对应不拒绝 |
10. 关键公式速查表
| 内容 | 公式 |
|---|---|
| pooled variance | |
| 等方差 t | |
| Welch t | |
| Welch df | |
| F 检验 | |
| 两比例 pooled | |
| 两比例 z | |
| 两比例 CI SE |
11. 学习建议
- 先判断是否独立;配对数据要转成差值。
- 均值比较先判断方差是否可认为相等。
- 方差比较用 F,但要检查正态假设。
- 比例检验记住 pooled;比例区间记住 unpooled。
- 所有双样本问题都围绕三类参数:差
、比 、差 。
12. 专题深化:两独立样本均值,等方差情形
设两组独立正态样本:
共同方差
12.1 差值均值的分布
因为两组独立,
若
但实际中
12.2 pooled variance
等方差假设下,两组样本方差都估计同一个
权重来自自由度。因为
两者独立相加后,
12.3 pooled t 统计量
因此
检验
时使用
置信区间为
12.4 Twain/Snodgrass 类署名例题的读法
文本分析中常用词频、句长或文本指标判断两组作者风格是否相同。变量通常是定量指标,分组是作者或文本来源。
做题步骤:
- 确认两个样本是否独立;
- 明确参数是
; - 判断能否假定等方差;
- 选择 pooled t 或 Welch t;
- 用 CI 或检验结论解释“是否有证据表明两组均值不同”。
统计结论只能说数据支持或不支持差异,不能单凭一个检验直接证明作者身份。
13. 专题深化:Welch 检验与 Behrens-Fisher 问题
若两组方差不能认为相等,则模型为
此时标准误估计为
Welch 统计量为
它不再精确服从简单的 t 分布,需要使用 Satterthwaite 自由度近似:
13.1 何时优先用 Welch
实践中,Welch 通常更稳健,尤其当:
- 两组样本量差异明显;
- 两组样本方差差异明显;
- 没有强理由相信总体方差相等。
pooled t 在等方差成立时更简洁,但等方差假设错时可能导致 Type I error 失控。
13.2 Welch 区间
置信区间为
这里自由度
14. 专题深化:方差比推断
14.1 F 统计量
若两组来自正态总体且独立,则
检验
时,统计量为
若备择是
14.2 方差比置信区间
对方差比
的区间来自
反解可得形如
的区间。具体上下尾记号取决于教材使用右尾还是左尾分位数,复习时要在全文中保持同一种分位数记法。
14.3 正态性警告
F 检验对正态性很敏感。若总体重尾或明显偏态,方差检验可能非常不稳健。
实际分析中,经常结合图形检查、稳健方法或置换/自助法。
15. 专题深化:两比例推断
设
相互独立。目标是比较
15.1 两比例置信区间
样本比例为
大样本下,
区间估计通常使用 unpooled 标准误:
置信区间:
15.2 两比例检验为什么用 pooled
检验
时,原假设认为两组共享同一个比例
检验统计量为
重点:
| 任务 | 标准误 |
|---|---|
| CI for | unpooled |
| Test | pooled |
15.3 Carbolic acid 类例题的读法
如果题目中出现两组病人、两种处理、两组成功/失败计数,数据结构通常是两个独立二项样本。
做题步骤:
- 写出
; - 计算
; - 明确目标是区间还是检验;
- 区间用 unpooled SE;
- 检验
用 pooled SE; - 解释差异方向和统计显著性。
16. 专题深化:配对样本作为单样本问题
虽然本章标题是双样本,但配对数据不能直接当作两个独立样本。
设每个对象有两个测量:
定义差值:
问题变为
使用单样本 t 统计量:
在正态差值假设下成立。
配对设计的关键是利用同一个对象内的相关性。若
17. 本章复习清单
| 核心内容 | 复习时要能做到 |
|---|---|
| 两独立样本均值 | 会写 |
| pooled variance | 能解释自由度权重 |
| pooled t | 知道等方差下自由度为 |
| Welch t | 会写标准误和近似自由度 |
| 等方差判断 | 知道样本量不平衡时 Welch 更稳健 |
| 方差比 | 会构造 F 统计量 |
| F 检验 | 知道强依赖正态性 |
| 两比例 CI | 使用 unpooled 标准误 |
| 两比例检验 | 使用 pooled 比例 |
| 配对样本 | 会转成差值做单样本 t |
| 结果解释 | 能区分统计显著与实际意义 |
18. 综合深化:实例、稳健性与报告规范
18.1 作者识别中的合并方差 t 检验
比较马克·吐温与斯诺格拉斯文章中三字母词比例时,在独立、近似正态且两总体方差相等的模型下,可用 pooled t 检验。该例计算得到
这个结论依赖“文章是合适的独立抽样单位”等设计假设。统计显著只能说明所选语言特征的总体均值存在证据差异,不能单凭一个指标完成作者身份认定。
18.2 为什么通常优先 Welch 检验
传统流程常先做 F 检验,再根据方差是否显著不同选择 pooled 或 Welch t 检验。但这种数据驱动的两阶段选择会改变整体检验性质,而且 F 检验对非正态性敏感。Welch 检验在方差相等时效率损失通常很小,在方差不等且样本量不平衡时更可靠,因此实践中可把 Welch 作为独立两样本均值比较的默认选择;只有等方差假设有充分设计或学科依据时再采用 pooled 方法。
18.3 李斯特消毒手术:两比例检验
消毒组
统计量为
在单侧 5% 水平下拒绝“存活率相同”。同时还应报告风险差
它比单独报告 p-value 更直观地表达效果大小。历史数据的非随机化、同期医疗条件等仍会影响因果解释。
18.4 “没有显著差异”不等于“完全相同”
在男女性噩梦比例的例子中,标准化统计量约为
18.5 区间与检验的对偶关系
对同一模型、同一标准误和同一双侧显著性水平,检验
配对设计也遵循同一原则:先把每对数据转成差值,再对差值均值构造单样本 t 区间与检验。不能把配对数据误用独立两样本公式。