Skip to content

第 10 章:基于正态分布的推断

本章把正态总体下的精确抽样分布系统化:t 分布、χ2 分布、F 分布,以及它们在均值和方差推断中的应用。


0. 本章定位

第 9 章的许多检验默认 σ 已知,因此可以用

Z=Y¯μσ/n

但现实里 σ 往往未知,要用样本标准差 S 替代。
这会把标准正态统计量变成 Student t 统计量:

Y¯μS/n

知识链条:

正态样本
  -> 样本均值与样本方差
  -> χ² 分布刻画 S²
  -> t 分布刻画 (Ybar-μ)/(S/sqrt(n))
  -> F 分布刻画方差比
  -> μ 与 σ² 的置信区间/检验

1. 三个抽样分布

1.1 χ2 分布

Z1,,Zm 独立且均为标准正态,则

U=j=1mZj2χm2

m 称为自由度。

1.2 F 分布

Uχm2,Vχn2

且独立,则

F=U/mV/nFm,n

它用于比较两个方差。

1.3 Student t 分布

ZN(0,1),Uχn2

且独立,则

T=ZU/ntn

t 分布对称、尾部比正态更厚;自由度越大,越接近标准正态。


2. 正态样本的关键定理

Y1,,Yni.i.d.N(μ,σ2)

样本均值:

Y¯=1ni=1nYi

样本方差:

S2=1n1i=1n(YiY¯)2

则:

Y¯N(μ,σ2n)(n1)S2σ2χn12

并且 Y¯S2 独立。

因此:

T=Y¯μS/ntn1

这是本章最重要的公式。


3. 对均值 μ 的置信区间

σ2 未知,使用 t 分布。

P(tα/2,n1Y¯μS/ntα/2,n1)=1α

反解 μ

μ[y¯tα/2,n1sn,y¯+tα/2,n1sn]

这就是 100(1α)% 的均值置信区间。


4. 单样本 t 检验

检验:

H0:μ=μ0

统计量:

t=y¯μ0s/n

H0 下:

ttn1

4.1 右尾

H1:μ>μ0

拒绝:

ttα,n1

4.2 左尾

H1:μ<μ0

拒绝:

ttα,n1

4.3 双尾

H1:μμ0

拒绝:

|t|tα/2,n1

5. 正态性假设与稳健性

单样本 t 检验的精确结论依赖正态总体。若总体明显偏态且样本很小,t 检验可能不可靠。

但随着 n 增大:

  • Y¯ 由 CLT 近似正态;
  • S 逐渐稳定;
  • t 统计量通常有较好的近似。

所以判断时要同时看:

  1. 样本量;
  2. 数据是否严重偏态;
  3. 是否有极端异常值。

6. 对方差 σ2 的置信区间

(n1)S2σ2χn12

可得:

P(χα/2,n12(n1)S2σ2χ1α/2,n12)=1α

反解 σ2

σ2[(n1)s2χ1α/2,n12,(n1)s2χα/2,n12]

方差区间不是对称的,因为 χ2 分布是右偏的。

标准差区间就是对上述上下界开平方:

σ[(n1)s2χ1α/2,n12,(n1)s2χα/2,n12]

7. 方差检验

检验:

H0:σ2=σ02

统计量:

χ2=(n1)s2σ02

H0 下:

χ2χn12

右尾检验:

H1:σ2>σ02,χ2χ1α,n12

左尾检验:

H1:σ2<σ02,χ2χα,n12

双尾检验:

H1:σ2σ02

拒绝域:

χ2χα/2,n12orχ2χ1α/2,n12

8. 本章知识图谱

                    正态分布推断
                         |
       ┌─────────────────┼─────────────────┐
       |                 |                 |
   抽样分布            均值 μ             方差 σ²
       |                 |                 |
 χ²: 正态平方和       t 区间             χ² 区间
       |                 |                 |
 t: Z/sqrt(χ²/df)     t 检验             χ² 检验
       |
 F: 两个χ²比值
       |
 后续双样本方差比较

9. 易错点与考点

误区正确认识
σ 未知还用 Z小样本正态且 σ 未知用 t
t 分布和正态完全一样t 尾部更厚,自由度大时才接近正态
方差区间上下界顺序随便写反解 σ2 会导致 χ2 分位数上下对调
χ2 分布对称χ2 右偏,区间不对称
S2Y¯ 总独立正态样本下成立,一般分布不一定
t 检验不怕任何非正态大样本较稳健,小样本严重偏态要谨慎

10. 关键公式速查表

内容公式
样本方差S2=1n1(YiY¯)2
卡方统计量(n1)S2/σ2χn12
t 统计量(Y¯μ)/(S/n)tn1
均值 CIy¯±tα/2,n1s/n
单样本 t 检验t=(y¯μ0)/(s/n)
方差 CI[(n1)s2/χ1α/22, (n1)s2/χα/22]
方差检验χ2=(n1)s2/σ02
F 分布(U/m)/(V/n)Fm,n

11. 学习建议

  1. 先背正态样本三件套:Y¯ 正态、(n1)S2/σ2 卡方、二者独立。
  2. 均值问题看 σ 是否已知:未知用 t
  3. 方差问题统一用 χ2
  4. 方差置信区间反解时特别注意上下界。
  5. 本章是第 12 章双样本推断的前置知识,尤其是 tχ2F 的关系。

12. 专题深化:正态样本三件套从哪里来

本章建立在一个非常关键的事实上:正态样本中,样本均值和样本方差有特殊的精确分布。

Y1,,YnN(μ,σ2)

独立同分布。

12.1 样本均值的分布

因为正态变量的线性组合仍为正态,

Y¯=1ni=1nYi

也服从正态分布。其均值和方差为

E(Y¯)=μ,Var(Y¯)=σ2n.

所以

Y¯N(μ,σ2n).

标准化得到

Z=Y¯μσ/nN(0,1).

这就是已知方差时 z 区间和 z 检验的来源。

12.2 样本方差的卡方分布

样本方差定义为

S2=1n1i=1n(YiY¯)2.

正态样本下有

(n1)S2σ2χn12.

自由度是 n1,因为估计了一个均值 Y¯,残差满足

i=1n(YiY¯)=0.

所以只有 n1 个独立方向。

12.3 样本均值与样本方差独立

正态样本下,

Y¯  S2.

这是正态分布的特殊性质,一般分布不一定成立。

有了这条独立性,才能把

Z=Y¯μσ/n

U=(n1)S2σ2

组合成 t 统计量。

12.4 t 分布的构造

ZN(0,1),Uχν2,

Z,U 独立,则

T=ZU/νtν.

代入正态样本:

T=(Y¯μ)/(σ/n)[(n1)S2/σ2]/(n1)=Y¯μS/ntn1.

这就是未知方差时用 t 而不是 z 的原因。

12.5 F 分布的构造

Uχm2,Vχn2

独立,则

F=U/mV/nFm,n.

后续两样本方差比较和 ANOVA 都依赖这个结构。


13. 专题深化:单样本均值推断

13.1 已知 σ 的置信区间

σ 已知,

Y¯μσ/nN(0,1).

因此

P(zα/2Y¯μσ/nzα/2)=1α.

反解 μ

μ[Y¯zα/2σn,Y¯+zα/2σn].

13.2 未知 σ 的置信区间

σ 未知,用 S 替换并改用 t 分布:

Y¯μS/ntn1.

所以

μ[Y¯tα/2,n1Sn,Y¯+tα/2,n1Sn].

13.3 单样本 t 检验

检验

H0:μ=μ0

使用统计量

t=y¯μ0s/n.

H0 下,

Ttn1.

根据备择方向选择左尾、右尾或双尾。

13.4 t 区间与 t 检验的对应

对双侧检验而言,在同一显著性水平下:

μ0100(1α)% CI拒绝 H0:μ=μ0.

这条对应在解释结果时很有用。


14. 专题深化:方差推断

14.1 方差置信区间

正态样本下,

(n1)S2σ2χn12.

因此

P(χ1α/2,n12(n1)S2σ2χα/2,n12)=1α

其中本笔记沿用“右尾面积”为下标的记法。反解时要注意 σ2 在分母,会导致上下界调换:

[(n1)s2χα/2,n12,(n1)s2χ1α/2,n12]

若教材用左尾分位数记号,公式表面会不同,但逻辑一致。

14.2 方差检验

检验

H0:σ2=σ02

使用统计量

χ2=(n1)s2σ02.

右尾备择 H1:σ2>σ02 时,大的 s2 支持备择,因此拒绝域在右尾。

左尾备择 H1:σ2<σ02 时,拒绝域在左尾。

双尾备择时看两端。

14.3 正态性假设的重要性

均值 t 推断在大样本下对轻微非正态较稳健;但方差的卡方推断对正态性更敏感。

原因是 (n1)S2/σ2 的卡方分布是正态样本的精确结果。若总体严重偏态或重尾,方差区间和检验可能失真。


15. 专题深化:Type II Error 与非中心分布直觉

在单样本 t 检验中,Type II error 的计算比 z 检验更复杂,因为检验统计量在备择下通常服从非中心 t 分布。

对检验

H0:μ=μ0,H1:μ>μ0

统计量

T=Y¯μ0S/n.

若真实均值为 μa>μ0,则 T 的中心会向右移动。移动量由

δ=μaμ0σ/n

控制,称为非中心参数。

直观结论:

  1. μaμ0 越大,功效越高;
  2. n 越大,功效越高;
  3. σ 越大,功效越低;
  4. α 越小,拒绝域越严格,功效通常越低。

若要求手算,常用 z 近似或给出分布表;理解方向比记复杂公式更重要。


16. 本章复习清单

核心内容复习时要能做到
正态样本均值会写 Y¯N(μ,σ2/n)
样本方差会写 (n1)S2/σ2χn12
独立性知道 Y¯S2 在正态下独立
t 分布会从 Z/U/ν 构造
F 分布会从两个独立卡方比构造
均值 CI能区分已知 σ 与未知 σ
单样本 t 检验会按备择方向选尾部
方差 CI反解时能处理上下界
方差检验会判断大方差或小方差对应哪个尾
非正态风险知道方差推断比均值推断更敏感

17. 综合深化:正交分解、方差区间与非中心 t

17.1 为什么样本均值与样本方差独立

X=(X1,,Xn)N(μ1,σ2I)。取一个 n×n 正交矩阵 A,令其最后一行为 1/n,并定义

Z=AXμ1σ.

由于正交变换保持标准多元正态分布,Z1,,Zn 相互独立且均服从 N(0,1)。最后一个坐标为

Zn=n(X¯μ)σ,

其余 n1 个坐标张成与 1 正交的残差空间,并满足

j=1n1Zj2=(n1)S2σ2χn12.

因此,均值坐标与残差坐标独立,进而得到 X¯S2。这也是 t 分布、均值 t 检验和方差卡方推断能够精确成立的核心。

17.2 方差置信区间的实际计算模板

对来自正态总体的 n 个观测,100(1α)% 方差置信区间为

[(n1)S2χ1α/2,n12,(n1)S2χα/2,n12].

例如矿物钾氩年龄的 n=19 个观测,应使用自由度 18 的卡方分位数。计算时先确认软件的分位数定义,再注意较大的卡方分位数出现在区间下界;若研究目标是标准差,最后对两个端点开平方。

17.3 非中心 t 分布与检验功效

对右侧单样本 t 检验 H0:μ=μ0H1:μ>μ0,当真实均值为 μ1 时,

T=X¯μ0S/n=Z+δU/(n1),δ=n(μ1μ0)σ,

其中 ZN(0,1)Uχn12 且相互独立。因此 T 服从非中心 t 分布,功效为

Pμ1(T>t1α,n1).

非中心参数 δ 把效应大小、样本量和噪声统一到一个无量纲尺度中,可直接用于功效分析和样本量设计。

17.4 精确结论与渐近结论的边界

正态样本下的 t、卡方和 F 分布结论是有限样本精确结论。非正态总体下,样本均值常可借助 CLT 近似正态,但 (n1)S2/σ2 一般不再服从卡方分布,均值与样本方差也未必独立。因此,小样本方差推断尤其依赖正态假设,应结合图形诊断、稳健方法或重抽样方法。