Skip to content

第 12 章:双样本推断(Two-Sample Inferences)

本章研究两个总体之间的比较:均值是否相等?方差是否相等?两个比例是否相等?对应的置信区间如何构造?


0. 本章定位

第 10 章解决单个正态总体的均值和方差推断。
第 12 章把问题扩展到两个独立样本:

X1,,Xn

Y1,,Ym

核心对象从单个参数变成参数差或参数比:

μXμY,σX2σY2,pXpY

1. 两样本均值检验:等方差情形

1.1 模型假设

设两组样本独立:

XiN(μX,σ2),YjN(μY,σ2)

注意这里假设两组方差相同。

1.2 pooled variance

两个样本方差分别为 SX2,SY2,合并方差为:

Sp2=(n1)SX2+(m1)SY2n+m2

这是对共同方差 σ2 的估计。

1.3 两样本 t 统计量

T=X¯Y¯(μXμY)Sp1/n+1/mtn+m2

检验

H0:μX=μY

时使用:

t=x¯y¯sp1/n+1/m

1.4 单边与双边

右尾:

H1:μX>μY,ttα,n+m2

左尾:

H1:μX<μY,ttα,n+m2

双尾:

H1:μXμY,|t|tα/2,n+m2

2. Behrens-Fisher 问题:不等方差情形

σX2σY2,不能使用 pooled variance。

使用 Welch 统计量:

W=X¯Y¯(μXμY)SX2/n+SY2/m

近似服从 tν,自由度用 Welch-Satterthwaite 近似:

ν(SX2/n+SY2/m)2(SX2/n)2n1+(SY2/m)2m1

实际数据分析中,Welch 两样本 t 检验通常比强行等方差更稳健。


3. 两总体方差比较:F 检验

3.1 基本分布

若两组正态样本独立,则

SX2/σX2SY2/σY2Fn1,m1

检验:

H0:σX2=σY2

统计量:

F=SX2SY2

H0 下:

FFn1,m1

3.2 备择方向

右尾:

H1:σX2>σY2

拒绝:

FF1α,n1,m1

左尾:

H1:σX2<σY2

双尾时两边都要看。

注意:F 检验对正态性很敏感。若数据明显非正态,要谨慎。


4. 两个比例比较:H0:pX=pY

4.1 数据结构

两组 Bernoulli / Binomial 数据:

p^X=Xn,p^Y=Ym

检验:

H0:pX=pY

4.2 pooled estimate

H0 下两个比例相同,记为 p,用合并估计:

p^=X+Yn+m

4.3 z 统计量

Z=p^Xp^Yp^(1p^)(1/n+1/m)N(0,1)

根据备择方向选择右尾、左尾或双尾。


5. 两样本均值差的置信区间

5.1 等方差正态情形

μXμY(x¯y¯)±tα/2,n+m2sp1/n+1/m

若区间不包含 0,与双侧 t 检验拒绝 H0:μX=μY 一致。

5.2 不等方差情形

使用 Welch 标准误:

(x¯y¯)±tα/2,νsX2/n+sY2/m

其中 ν 为 Welch 近似自由度。


6. 方差比的置信区间

SX2/σX2SY2/σY2Fn1,m1

可得:

σX2σY2[sX2/sY2F1α/2,n1,m1,sX2/sY2Fα/2,n1,m1]

不同教材对 Fα 记号可能使用“右尾”或“左尾”约定,使用表格时要确认分位数定义。


7. 两比例差的置信区间

置信区间不使用 H0 下的 pooled 估计,而使用各自样本比例:

pXpY(p^Xp^Y)±zα/2p^X(1p^X)n+p^Y(1p^Y)m

检验时 pooled,区间时 unpooled,这是常见考点。


8. 本章知识图谱

                        双样本推断
                            |
       ┌────────────────────┼────────────────────┐
       |                    |                    |
    均值比较              方差比较              比例比较
       |                    |                    |
 等方差 -> pooled t       F test               pooled z test
       |                    |                    |
 不等方差 -> Welch t      方差比CI             p_X-p_Y CI
       |
 μ_X-μ_Y CI
       |
 paired? -> 不属于独立双样本,回到差值的一样本 t

9. 易错点与考点

误区正确认识
两组数据一定独立配对数据不能用本章独立两样本公式
方差不等也用 pooled t应使用 Welch t 检验
两比例 CI 使用 pooled 比例检验用 pooled,CI 通常用各自比例
F 检验不要求正态F 检验强依赖正态性
两样本 t 自由度是 n+m等方差情形是 n+m2
CI 包含 0 还能双侧拒绝同一设定下,包含 0 通常对应不拒绝

10. 关键公式速查表

内容公式
pooled varianceSp2=(n1)SX2+(m1)SY2n+m2
等方差 tX¯Y¯Sp1/n+1/m
Welch tX¯Y¯SX2/n+SY2/m
Welch df(SX2/n+SY2/m)2(SX2/n)2/(n1)+(SY2/m)2/(m1)
F 检验F=SX2/SY2
两比例 pooledp^=(X+Y)/(n+m)
两比例 zp^Xp^Yp^(1p^)(1/n+1/m)
两比例 CI SEp^X(1p^X)/n+p^Y(1p^Y)/m

11. 学习建议

  1. 先判断是否独立;配对数据要转成差值。
  2. 均值比较先判断方差是否可认为相等。
  3. 方差比较用 F,但要检查正态假设。
  4. 比例检验记住 pooled;比例区间记住 unpooled。
  5. 所有双样本问题都围绕三类参数:差 μXμY、比 σX2/σY2、差 pXpY

12. 专题深化:两独立样本均值,等方差情形

设两组独立正态样本:

X1,,XnN(μX,σ2),Y1,,YmN(μY,σ2).

共同方差 σ2 未知,但假定两组相同。

12.1 差值均值的分布

因为两组独立,

X¯Y¯N(μXμY,σ2(1n+1m)).

σ 已知,可直接用 z 统计量:

Z=(X¯Y¯)(μXμY)σ1/n+1/m.

但实际中 σ 通常未知。

12.2 pooled variance

等方差假设下,两组样本方差都估计同一个 σ2。合并估计为

Sp2=(n1)SX2+(m1)SY2n+m2.

权重来自自由度。因为

(n1)SX2σ2χn12,(m1)SY2σ2χm12,

两者独立相加后,

(n+m2)Sp2σ2χn+m22.

12.3 pooled t 统计量

因此

T=(X¯Y¯)(μXμY)Sp1/n+1/mtn+m2.

检验

H0:μXμY=Δ0

时使用

t=(x¯y¯)Δ0sp1/n+1/m.

置信区间为

(x¯y¯)±tα/2,n+m2sp1n+1m.

12.4 Twain/Snodgrass 类署名例题的读法

文本分析中常用词频、句长或文本指标判断两组作者风格是否相同。变量通常是定量指标,分组是作者或文本来源。

做题步骤:

  1. 确认两个样本是否独立;
  2. 明确参数是 μXμY
  3. 判断能否假定等方差;
  4. 选择 pooled t 或 Welch t;
  5. 用 CI 或检验结论解释“是否有证据表明两组均值不同”。

统计结论只能说数据支持或不支持差异,不能单凭一个检验直接证明作者身份。


13. 专题深化:Welch 检验与 Behrens-Fisher 问题

若两组方差不能认为相等,则模型为

XiN(μX,σX2),YjN(μY,σY2).

此时标准误估计为

SE=SX2n+SY2m.

Welch 统计量为

T=(X¯Y¯)(μXμY)SX2/n+SY2/m.

它不再精确服从简单的 t 分布,需要使用 Satterthwaite 自由度近似:

ν=(SX2/n+SY2/m)2(SX2/n)2/(n1)+(SY2/m)2/(m1).

13.1 何时优先用 Welch

实践中,Welch 通常更稳健,尤其当:

  1. 两组样本量差异明显;
  2. 两组样本方差差异明显;
  3. 没有强理由相信总体方差相等。

pooled t 在等方差成立时更简洁,但等方差假设错时可能导致 Type I error 失控。

13.2 Welch 区间

置信区间为

(x¯y¯)±tα/2,νsX2n+sY2m.

这里自由度 ν 通常不是整数,软件会直接计算。


14. 专题深化:方差比推断

14.1 F 统计量

若两组来自正态总体且独立,则

SX2/σX2SY2/σY2Fn1,m1.

检验

H0:σX2=σY2

时,统计量为

F=SX2SY2.

若备择是 σX2>σY2,拒绝域在右尾;若备择是 σX2<σY2,拒绝域在左尾;双尾则看两端。

14.2 方差比置信区间

对方差比

σX2σY2

的区间来自

SX2/SY2σX2/σY2Fn1,m1.

反解可得形如

[sX2/sY2Fα/2,n1,m1,sX2/sY2F1α/2,n1,m1]

的区间。具体上下尾记号取决于教材使用右尾还是左尾分位数,复习时要在全文中保持同一种分位数记法。

14.3 正态性警告

F 检验对正态性很敏感。若总体重尾或明显偏态,方差检验可能非常不稳健。

实际分析中,经常结合图形检查、稳健方法或置换/自助法。


15. 专题深化:两比例推断

XBin(n,pX),YBin(m,pY)

相互独立。目标是比较

pXpY.

15.1 两比例置信区间

样本比例为

p^X=Xn,p^Y=Ym.

大样本下,

p^Xp^YN(pXpY,pX(1pX)n+pY(1pY)m).

区间估计通常使用 unpooled 标准误:

SE=p^X(1p^X)n+p^Y(1p^Y)m.

置信区间:

(p^Xp^Y)±zα/2SE.

15.2 两比例检验为什么用 pooled

检验

H0:pX=pY

时,原假设认为两组共享同一个比例 p。因此用合并估计

p^=X+Yn+m.

检验统计量为

Z=p^Xp^Yp^(1p^)(1/n+1/m).

重点:

任务标准误
CI for pXpYunpooled
Test H0:pX=pYpooled

15.3 Carbolic acid 类例题的读法

如果题目中出现两组病人、两种处理、两组成功/失败计数,数据结构通常是两个独立二项样本。

做题步骤:

  1. 写出 x,n,y,m
  2. 计算 p^X,p^Y
  3. 明确目标是区间还是检验;
  4. 区间用 unpooled SE;
  5. 检验 pX=pY 用 pooled SE;
  6. 解释差异方向和统计显著性。

16. 专题深化:配对样本作为单样本问题

虽然本章标题是双样本,但配对数据不能直接当作两个独立样本。

设每个对象有两个测量:

(Xi,Yi),i=1,,n.

定义差值:

Di=XiYi.

问题变为

H0:μD=0.

使用单样本 t 统计量:

T=D¯SD/ntn1

在正态差值假设下成立。

配对设计的关键是利用同一个对象内的相关性。若 Xi,Yi 正相关,则差值方差可能显著小于独立比较的方差,从而提高检验功效。


17. 本章复习清单

核心内容复习时要能做到
两独立样本均值会写 X¯Y¯ 的均值和方差
pooled variance能解释自由度权重
pooled t知道等方差下自由度为 n+m2
Welch t会写标准误和近似自由度
等方差判断知道样本量不平衡时 Welch 更稳健
方差比会构造 F 统计量
F 检验知道强依赖正态性
两比例 CI使用 unpooled 标准误
两比例检验使用 pooled 比例
配对样本会转成差值做单样本 t
结果解释能区分统计显著与实际意义

18. 综合深化:实例、稳健性与报告规范

18.1 作者识别中的合并方差 t 检验

比较马克·吐温与斯诺格拉斯文章中三字母词比例时,在独立、近似正态且两总体方差相等的模型下,可用 pooled t 检验。该例计算得到 t=3.88,表明两组均值相对于组内波动相差较大。

这个结论依赖“文章是合适的独立抽样单位”等设计假设。统计显著只能说明所选语言特征的总体均值存在证据差异,不能单凭一个指标完成作者身份认定。

18.2 为什么通常优先 Welch 检验

传统流程常先做 F 检验,再根据方差是否显著不同选择 pooled 或 Welch t 检验。但这种数据驱动的两阶段选择会改变整体检验性质,而且 F 检验对非正态性敏感。Welch 检验在方差相等时效率损失通常很小,在方差不等且样本量不平衡时更可靠,因此实践中可把 Welch 作为独立两样本均值比较的默认选择;只有等方差假设有充分设计或学科依据时再采用 pooled 方法。

18.3 李斯特消毒手术:两比例检验

消毒组 34/40 存活,未消毒组 19/35 存活。检验 H0:p1=p2 时,零假设下采用合并比例

p^=34+1940+35=5375.

统计量为

Z=34/4019/35p^(1p^)(1/40+1/35)2.9.

在单侧 5% 水平下拒绝“存活率相同”。同时还应报告风险差

p1p2^0.307,

它比单独报告 p-value 更直观地表达效果大小。历史数据的非随机化、同期医疗条件等仍会影响因果解释。

18.4 “没有显著差异”不等于“完全相同”

在男女性噩梦比例的例子中,标准化统计量约为 0.62,证据不足以拒绝两比例相等。正确表述是“当前样本未提供足够差异证据”,而不是证明两个总体比例完全相同。若目标是证明差异足够小,应预先给定实际等价界并进行等价性检验。

18.5 区间与检验的对偶关系

对同一模型、同一标准误和同一双侧显著性水平,检验 H0:θ=θ0 在水平 α 下拒绝,当且仅当 100(1α)% 置信区间不包含 θ0。区间还同时展示方向、效果量与精度,因此结果报告通常应以估计值和区间为主体,以 p-value 为补充。

配对设计也遵循同一原则:先把每对数据转成差值,再对差值均值构造单样本 t 区间与检验。不能把配对数据误用独立两样本公式。