Skip to content

第 14 章:收缩估计与单因素方差分析

本章连接两个看似不同、实际上共享同一思想的主题:估计多个参数时如何借用整体结构降低风险,以及比较多个总体时如何把总变异拆成组间变异与组内变异。


0. 本章知识图谱

图表渲染中…

核心思想是:

  • 单独估计每个参数会浪费组间共同结构;
  • 单独比较许多组对会浪费整体变异分解,并放大第一类错误;
  • 合理地“汇总信息”能够降低风险或提高检验功效。

1. 从无偏性转向风险

1.1 平方损失与均方误差

估计参数向量 θRp 时,常用平方损失

L(θ,δ)=δθ22.

估计规则 δ(Y) 的频率学风险为

R(θ,δ)=Eθδ(Y)θ22.

一维情况下,MSE 分解为

Eθ(θ^θ)2=Varθ(θ^)+Biasθ(hatθ)2.

因此,“无偏”只是让第二项为零,不保证总风险最小。若引入少量偏差能显著降低方差,总 MSE 反而会更小。

1.2 可容许性与支配

若存在另一个估计量 δ1,使

R(θ,δ1)R(θ,δ0)对所有 θ,

并且至少在某些 θ 处严格小于,则称 δ1 支配 δ0。被其他估计量支配的规则称为不可容许。

这比比较某个固定参数点的 MSE 更强:支配要求在整个参数空间都不差。


2. Normal-Normal 模型中的 Bayes 收缩

先看一维模型:

YθN(θ,σ2),θN(μ,τ2).

后验仍为正态,其均值为

E(θY)=τ2τ2+σ2Y+σ2τ2+σ2μ.

B=σ2τ2+σ2,

则平方损失下的 Bayes 估计为

θ^B=(1B)Y+Bμ.

它把观测值向先验中心 μ 收缩:

  • τ2 大:各组真实参数差异大,对共同中心信任少,收缩弱;
  • σ2 大:单组观测噪声大,更依赖总体信息,收缩强;
  • σ20:观测几乎无噪声,θ^BY

这种“向中心拉近”不是任意修改数据,而是后验均值的直接结果。


3. 经验 Bayes:从多组数据学习收缩强度

YiθiN(θi,σ2),θii.i.d.N(μ,τ2),i=1,,p.

μ,τ2 已知,则每个参数的后验均值为

θ^i=(1B)Yi+Bμ.

实际中超参数未知,可由全部 Yi 估计:

μ^=Y¯,

而边缘分布 YiN(μ,τ2+σ2),所以可用样本方差减去 σ2 估计 τ2

τ^2=(SY2σ2)+.

代回得到经验 Bayes 估计。其意义是“向他人学习”:每组保留自身数据,同时借用其他组估计出的共同中心与组间离散程度。

典型应用包括多名运动员的真实命中率、多家医院的风险率、多个地区的患病率、多个广告单元的转化率。样本很少的组通常收缩更多,样本充分的组收缩较少。


4. James-Stein 现象

4.1 基本设定

YNp(θ,σ2Ip),

最自然的 MLE 为

θ^0=Y.

它在平方损失下的风险为

R(θ,Y)=EθYθ2=pσ2.

p3 时,James-Stein 估计量

θ^JS=(1(p2)σ2Y2)Y

在所有参数点的风险都不大于 Y,并在非平凡区域严格更小。因此 Yp3 时不可容许。

4.2 正部 James-Stein

Y2<(p2)σ2 时,上式收缩因子为负,会把方向反转。常用正部版本

θ^JS+=(1(p2)σ2Y2)+Y,

其中 (a)+=max(a,0)。它通常进一步降低风险。

4.3 向非零中心收缩

若希望向已知中心 mRp 收缩,可写为

θ^JS,m=m+(1(p2)σ2Ym2)(Ym).

若中心也由同一数据选择,风险分析需要额外处理。向样本均值所在的一维子空间收缩时,有效维数和系数也会相应改变。

4.4 正确理解“更优”

James-Stein 结论比较的是向量总平方误差:

j=1p(θ^jθj)2.

它不保证每一个分量在每一次样本中都更接近真值,也不意味着任何相关变量或异方差问题都能直接套用上述公式。协方差已知但非球形时,应先白化或使用相应广义形式。


5. 从两个总体推广到多个总体

两样本 t 检验只能比较两个均值。若有 k3 个处理组,逐对做

(k2)

次 t 检验会导致整体第一类错误率膨胀。例如每次检验水平为 0.05,若 10 次检验近似独立,至少一次假阳性的概率约为

1(10.05)100.401.

单因素方差分析先检验整体假设

H0:μ1=μ2==μk,

在拒绝后再进行受控制的组间比较。


6. 单因素 ANOVA 模型

j 个处理组有 nj 个观测:

Yij=μj+εij,εiji.i.d.N(0,σ2),

其中 i=1,,njj=1,,k。等价地可写成效应模型

Yij=μ+τj+εij,jnjτj=0.

三条核心假设:

  1. 独立性:不同实验单元的误差独立;
  2. 正态性:每组误差近似正态;
  3. 方差齐性:各组共享方差 σ2

独立性主要由实验设计保证,不能靠正态性检验补救。F 检验对温和非正态通常较稳健,但对严重异方差且组样本量不平衡较敏感。


7. 平方和分解

N=j=1knj,Y¯j=1njiYij,Y¯=1Nj,iYij.

总离差可分解为

YijY¯=(YijY¯j)+(Y¯jY¯).

平方并求和,交叉项因每组内部离差和为 0 而消失,得到

SSTot=SSTr+SSE,

其中

SSTot=j=1ki=1nj(YijY¯)2,SSTr=j=1knj(Y¯jY¯)2,SSE=j=1ki=1nj(YijY¯j)2.
  • SSTr 衡量组均值之间的变异;
  • SSE 衡量同组个体围绕组均值的随机变异;
  • SSTot 是不区分分组时的总变异。

8. F 检验为何成立

H0 下,所有组均值相同。正态模型给出

SSTrσ2χk12,SSEσ2χNk2,

且二者独立。因此均方

MSTr=SSTrk1,MSE=SSENk

之比满足

F=MSTrMSEFk1,Nk.

H0 下,两种均方都估计 σ2;在 H1 下,MSTr 还包含真实组间差异,因而倾向变大。拒绝域只在右尾。

变异成分平方和自由度均方检验统计量
处理/组间SSTrk1MSTrMSTr/MSE
误差/组内SSENkMSE
总计SSTotN1

9. 手算例子

三组数据为

(4,5),(6,7),(8,9).

组均值为 4.5,6.5,8.5,总均值为 6.5。于是

SSTr=2[(4.56.5)2+02+(8.56.5)2]=16.

每组内部平方和均为

(0.5)2+(0.5)2=0.5,

所以 SSE=1.5。自由度为 23

F=16/21.5/3=16.

这个值很大,说明组间均值差相对于组内波动较强。但 ANOVA 的整体结论仍只是“至少有两个均值不同”。


10. 效应大小

显著性依赖样本量;还应报告组间差异占总变异的比例。常见指标

η2=SSTrSSTot.

η2 在样本中通常偏乐观。偏差修正形式之一为

ω2=SSTr(k1)MSESSTot+MSE.

效应量应结合具体量纲下的均值差和置信区间解释,而不是只报告一个比例。


11. 对比:回答预先指定的问题

对比是组均值的线性组合

C=j=1kcjμj,j=1kcj=0.

例如三组中“前两组平均与第三组比较”可取

C=12μ1+12μ2μ3.

自然估计量为

C^=jcjY¯j,

其估计标准误

se^(C^)=MSEjcj2nj.

因此

t=C^se^(C^)tNk(H0:C=0).

预先计划的少数对比通常比事后搜索全部组对更有功效,也更容易形成可解释的科学问题。


12. Tukey 多重比较

整体 ANOVA 显著后,若希望比较所有组对,需要控制同时覆盖率或族错误率。

各组样本量相等为 n0 时,Tukey 同时置信区间为

(Y¯iY¯j)±q1α;k,NkMSEn0,

其中 q 是学生化极差分布分位数。

样本量不等时,Tukey-Kramer 区间为

(Y¯iY¯j)±q1α;k,NkMSE2(1ni+1nj).

若某个同时区间不包含 0,则对应组对在控制整体错误后显著不同。


13. 诊断与替代方法

13.1 残差图

残差为

eij=YijY¯j.

检查:

  • 残差随拟合值是否呈漏斗形:提示异方差;
  • QQ 图是否有严重弯曲或极端点:提示非正态或离群值;
  • 残差随采集顺序是否有结构:提示时间依赖;
  • 每组是否存在不同的数据质量或测量机制。

13.2 异方差

方差明显不等时可考虑 Welch ANOVA。不要把“先做方差齐性检验,再根据结果选择普通 ANOVA 或 Welch”当成完全无代价的流程,因为这种数据驱动选择会改变整体推断性质。

13.3 非正态与离群值

可考虑:

  • 对响应作有解释的变换;
  • 置换检验;
  • Kruskal-Wallis 秩检验;
  • 稳健位置估计与 bootstrap 区间。

替代方法改变的往往不只是计算方式,也可能改变所检验的参数或零假设。


14. 本章复习清单

核心内容需要做到
MSE会写偏差-方差分解,理解无偏不等于最小风险
Bayes 收缩会推 Normal-Normal 后验均值
经验 Bayes理解超参数由多组数据共同估计
James-Stein记住 p3、平方损失和整体风险含义
ANOVA 模型会写独立、正态、方差齐性假设
平方和会推 SSTot=SSTr+SSE
F 检验会写自由度、拒绝方向和整体假设
对比会检查系数和为 0 并计算标准误
Tukey理解为什么需要多重比较控制
诊断能根据异方差、依赖和离群值选择替代方案

15. 本章主线

text
多个参数 -> 单独估计噪声大 -> 共享结构 -> 收缩 -> 总体风险下降

多个均值 -> 总变异分解 -> 组间/组内均方 -> F 检验
       -> 整体拒绝 -> 计划对比或多重比较 -> 具体差异