Skip to content

第 8 章:参数估计 (Part II)

这一章是上一章(MLE、CRLB)的理论深化。如果说上一章在教你"怎么估计",这一章就在告诉你"什么样的估计才好""数据里多少信息是真正有用的"。 四大板块:

  1. 指数族(Exponential Family)
  2. 充分性(Sufficiency)
  3. 一致性(Consistency)
  4. 贝叶斯估计(Bayesian Estimation)

0. 总览:为什么要学这些?

上一章我们学到:

  • MLE 是个好估计方法
  • Fisher 信息告诉我们参数能被估计得多准
  • CRLB 给出了无偏估计方差的下界

但还有几个深刻的问题没回答:

  • 拿到 n 个样本,有没有办法把它们浓缩成几个数字而不丢失关于参数的信息?→ 充分性
  • 一类长得"特别好看"的分布(Bernoulli、Normal、Poisson、Gamma...)有什么共同的好性质?→ 指数族
  • 当样本量 n,估计量会不会收敛到真值?→ 一致性
  • 已有先验知识怎么办?怎么把它和数据结合?→ 贝叶斯估计

1. 指数族(Exponential Family)

1.1 为什么要研究"指数族"?

观察一下我们见过的分布:

分布pdf 形式
Bernoullipx(1p)1x
Poissoneλλxx!
Normal12πσe(xμ)2/(2σ2)
GammaλrΓ(r)xr1eλx

它们看起来形状各异,但都可以写成同一种形式

fθ(x)=exp{η(θ)T(x)ξ(θ)}h(x)

这就是"指数族"。把它们统一起来研究,能一次性证出很多深刻定理。

1.2 严格定义

定义:参数族 {Pθ:θΘ} 称为指数族,若存在

  • T(x):随机 p 维向量(充分统计量
  • η(θ):参数空间到 Rp 的映射(自然参数函数
  • h(x)0:和 θ 无关的函数
  • ξ(θ):归一化常数(保证 pdf 积分为 1)

使得:

fθ(x)=exp{η(θ)T(x)ξ(θ)}h(x)

其中 ξ(θ)=logexp{η(θ)T(x)}h(x)dx

1.3 自然参数化(Canonical Form)

最常见的简化形式:直接令 η=η(θ),把参数换成 η 本身:

fη(x)=exp{ηT(x)ζ(η)}h(x)
  • η自然参数(natural parameter)
  • Ξ={η(θ):θΘ}自然参数空间
  • Ξ 包含一个开集,称该指数族满秩(full rank)

直观:自然参数化就是把分布按"最舒服的坐标"重写一遍。原参数 θ(比如 Bernoulli 的 π)有 0π1 的约束,但换成 η=logπ1π(log-odds)就可以自由地在 R 里取值了。

1.4 例 1:Bernoulli

p(x|π)=πx(1π)1x=exp{xlogπ1π+log(1π)}

对照定义:

  • η=logπ1πlogit/对数几率
  • T(x)=x
  • ζ(η)=log(1π)=log(1+eη)
  • h(x)=1

要点ηπ 一一对应(π=eη1+eη,正是 sigmoid!)。这就是逻辑回归的来源。

1.5 例 2:Poisson

p(x|λ)=λxeλx!=1x!exp{xlogλλ}

对照:

  • η=logλ
  • T(x)=x
  • ζ(η)=λ=eη
  • h(x)=1/x!

1.6 例 3:Normal N(μ,σ2)

p(x|μ,σ2)=12πexp{μσ2x12σ2x2μ22σ2logσ}

对照(注意是 2 维参数):

  • η=(μσ2, 12σ2)
  • T(x)=(x,x2)
  • ζ(η)=μ22σ2+logσ
  • h(x)=12π

1.7 例 4:Multinomial(一个坑!)

朴素写法:

p(x|π)=n!x1!xm!exp{i=1mxilogπi}

但这样写不是满秩!因为约束 πi=1,自然参数 η=(logπ1,,logπm) 落在一个低维流形上,不含开集。

修正:消去最后一个 πm=1i=1m1πi,把 multinomial 写成:

p(x|π)=h(x)exp{i=1m1logπi1j<mπjxi+nlog(1πi)}

这时:

  • ηi=logπi1j=1m1πji=1,,m1(softmax 的反函数!)
  • T(x)=(x1,,xm1)
  • 现在 ηRm1 自由,满秩

要点:自然参数维度 = "真正的自由参数"个数。Multinomial 看起来 m 维,实际只有 m1 个自由度。

1.8 矩生成函数(Moment Generating Function)

定理:自然参数化的指数族,若 η0Ξ 的内点,则 T(X) 的 m.g.f. 在 0 附近有限,且:

ψη0(t)=exp{ζ(η0+t)ζ(η0)}

证明(很短,关键是用归一化条件):

ψη0(t)=E[etT(X)]=etT(x)eη0T(x)ζ(η0)h(x)dx=eζ(η0)e(η0+t)T(x)h(x)dx=eζ(η0)eζ(η0+t)

推论(极有用!):

E[T(X)]=ζη,Var(T(X))=2ζηη

即:ζ(η) 求一阶导得期望,求二阶导得方差

例:Bernoulli 验算

ζ(η)=log(1+eη)

dζdη=eη1+eη=π=E(X)d2ζdη2=eη(1+eη)2=π(1π)=Var(X)

回顾上一章Var(T)=I(η)(指数族里 Fisher 信息 = 充分统计量的方差),现在你知道为什么了:因为 I(η)=E[2lnf/η2]=2ζ/η2=Var(T)


2. 充分性(Sufficiency)

2.1 直觉:数据压缩不丢信息

假设你抛硬币 100 次,得到 100 个 0/1。如果有人问你 p 大概是多少,你不需要报告完整序列,只需要告诉对方"正面出现了几次"就够了。

这就是充分性的精髓:统计量 T(X) 已经"吸收"了样本里关于 θ 的全部信息

2.2 严格定义

定义:统计量 T(X) 称为充分(sufficient)的,若给定 T 后,X 的条件分布θ 无关

P(X=xT(X)=t,θ)=P(X=xT(X)=t)

解读:知道了 T 之后,原始数据 X 不再带任何额外的关于 θ 的信息。X 在给定 T 时的"残余随机性"和参数无关。

2.3 例:二项的充分统计量

X1,,Xn i.i.d. Bernoulli(θ),令 T=Xi

  • 边际:P(T=t)=(nt)θt(1θ)nt
  • 联合:P(X=x,T=t)=θt(1θ)nt(当 xi=t

条件分布:

P(X=xT=t)=θt(1θ)nt(nt)θt(1θ)nt=1(nt)

θ 完全无关!所以 T=Xi 是充分统计量。

直观解释:知道有 t 个正面后,所有"t 个正面在哪几次出现"的排列方式都同样可能,与 θ 无关。

2.4 因子分解定理(Factorization Theorem)

问题:每次都用条件分布去验证太麻烦了。有没有更直接的判定方法?——这是本章最重要的工具之一。

定理T(X) 充分 pdf 可以分解为:

fθ(x)=gθ(T(x))h(x)

其中:

  • gθ:只通过 T(x) 依赖于 θ
  • h(x):完全不依赖 θ

用法:拿到一个 pdf,看它如何随 θ 变化——能从 x 中"剥离"出来一个量 T(x) 使 θ 只通过它出现,那 T 就是充分统计量。

2.5 推论:指数族的充分统计量

对指数族 fθ(x)=exp{η(θ)T(x)ξ(θ)}h(x)

T(X) 自然就是充分统计量!(因为 θ 只通过 T(x) 出现)

分布充分统计量
BernoulliXi
PoissonXi
Normal(Xi,Xi2)
Multinomial各类频数

2.6 例:截断族(Truncation Families)

fθ(x)=c(θ)φ(x)1(a,b)(x)θ=(a,b)

联合 pdf:

i=1nfθ(xi)=[c(θ)]n1(a,)(x(1))1(,b)(x(n))i=1nφ(xi)

按因子分解:θ 只通过 (x(1),x(n)) 出现,所以 T=(X(1),X(n)) 充分。

2.7 例:顺序统计量始终是充分的(弱意义)

对任意 i.i.d. 样本:

f(xi)=f(x(i))

所以 T(X)=(X(1),,X(n)) 总是充分的——但这没什么压缩,等于把数据排了个序。

2.8 最小充分(Minimal Sufficient)

充分统计量不唯一。比如 X 自己、(X(1),,X(n))Xi 对 Bernoulli 都充分,但压缩程度不同

定义T最小充分,若对任何其他充分统计量 S,都存在函数 ψ 使 T=ψ(S) 几乎必然成立。

直觉:最小充分 = 把数据压缩到不能再压缩,但仍保留所有 θ 信息。

2.9 辅助统计量(Ancillary Statistic)

定义:统计量 V(X) 称为辅助的(ancillary),若 V 的分布完全不依赖 θ

XiN(μ,1)V=X1X2N(0,2),与 μ 无关。

意义:辅助统计量"看不见 θ"——它只反映分布的"形状特征"或"无关随机性"。

关键认识:如果一个充分统计量 T 的某个非常数函数是辅助的,说明 T 里还混有"和 θ 无关的内容"——它没把数据压缩到极致。 真正"干净"的充分统计量应该满足:它的非常数函数都不能是辅助的。这就引出了完备性

2.10 完备性(Completeness)

定义:统计量 T 称为完备,若对任何 Borel 函数 f

Eθ[f(T)]=0, θf(T)=0 a.s.

解读:唯一能让 T 的函数对所有 θ 期望为 0 的"诚实候选",就是恒等于 0 的那个函数。换言之,T 没有"虚假"的随机成分让 E[f(T)] 偶然为 0。

关键定理完备 + 充分 ⟹ 最小充分

指数族大定理:满秩指数族里,自然 T(X) 完备且充分。

2.11 例:Uniform U(0,θ)X(n)

fθ(x)=θn1[0,θ](x(n)),所以 X(n) 充分(因子分解)。

证完备:X(n) 的 pdf 为 nxn1/θn0xθ

Eθ[f(X(n))]=0,即

0θf(x)nxn1θndx=0, θ>0

G(θ)=0θf(x)xn1dx,则 G(θ)=0 对所有 θ 成立。

求导:G(θ)=f(θ)θn1=0f(θ)=0(因为 θ>0)。

X(n) 完备。

2.12 Basu 定理(漂亮且实用!)

定理:设 T有界完备充分统计量,V辅助统计量,则 TV(独立)。

意义:常用来"绕开"复杂的联合分布计算。

2.13 Basu 定理的经典应用:X¯S2 独立

X1,,XnN(μ,σ2)σ 已知

  • X¯ 充分完备(指数族的)
  • S2=1n1(XiX¯)2=1n1(ZiZ¯)2 其中 Zi=XiμN(0,σ2) —— 不依赖 μ,所以是辅助统计量!
  • 由 Basu 定理,X¯S2

由于 σ 任意,对一般 N(μ,σ2) 也成立。

进一步:用 m.g.f. 可推出 (n1)S2/σ2χn12

具体地:

n(X¯μσ)2+(n1)S2σ2=i=1n(Xiμσ)2χn2

左边第一项 χ12,且与 S2 独立。由 m.g.f.:

m.g.f. of (n1)S2/σ2=(12t)n/2(12t)1/2=(12t)(n1)/2

正是 χn12 的 m.g.f.,证毕。


3. 一致性(Consistency)

3.1 直觉

无偏性是"平均行为"——估计量的期望等于真值。但即便无偏,它的方差可能大得离谱。

一致性问的是:当样本量 n 越来越大,θ^n 是不是会越来越接近真值 θ

3.2 严格定义

θ^n 称为 θ一致估计,若依概率收敛θ

ε>0, limnP(|θ^nθ|<ε)=1

记作 θ^npθ

直观:随着 n 增大,θ^n "落在真值附近"的概率越来越高,最终趋于 1。

3.3 例 1:Uniform 的 X(n) 是一致的

Y1,,YnU(0,θ)θ^n=Ymax=X(n)

我们知道 E(Ymax)=nn+1θ有偏。但是否一致?

Ymax 的 pdf:fYmax(y)=nyn1/θn

P(|θ^nθ|<ε)=P(θε<Ymaxθ)=θεθnyn1θndy=[ynθn]θεθ=1(θεθ)n

由于 (θε)/θ<1n 时收敛到 0。所以:

limnP(|θ^nθ|<ε)=10=1

Ymax 一致(虽然有偏)

3.4 工具:Chebyshev / Markov 不等式

Markov 不等式X0t>0

P(Xt)E[X]t

更一般地,对 p>0

P(|X|t)E|X|ptp

Chebyshev 不等式φ 非负不减偶函数):

φ(t)P(|X|t)E[φ(X)]

最常用形式(取 φ(x)=x2):

P(|Xμ|t)Var(X)t2

3.5 例 2:样本均值是一致的

X1,,Xn i.i.d.,E(X)=μVar(X)=σ2<

μ^n=X¯,则 E(μ^n)=μVar(μ^n)=σ2/n

由 Chebyshev:

P(|μ^nμ|<ε)1σ2/nε2=1σ2nε2

n 时右边趋于 1。✅ X¯μ 的一致估计(这就是弱大数定律!)。

要点:方差有限 + 渐近无偏 ⟹ 一致。

3.6 MLE 的一致性与渐近最优性

接下来这部分是 本章最深的理论。我们已知:

  • MLE 不一定无偏
  • CRLB 给出无偏估计的方差下界 1/I(θ)

核心问题:MLE 在大样本下表现如何?

3.7 渐近正态性 + 渐近最优性

定义:估计量序列 {θ^n} 称为渐近正态,若存在正定矩阵 Vn(θ) 使得:

[Vn(θ)]1/2(θ^nθ)dNk(0,Ik)
  • Vn(θ) 是渐近协方差矩阵
  • V1n(θ)V2n(θ),则 θ^1n 渐近上更有效

渐近最优的定义:

θ^n 渐近最优Vn(θ)=[In(θ)]1

即渐近方差达到 CRLB 的极限

3.8 关键定理(MLE 渐近最优)

定理(粗略版):在合适的正则性条件下:

  1. 似然方程 sn(θ^n):=θ(θ^n)=0 存在解,且 θ^npθ(一致);
  2. 任何一致的似然方程根 θ~n 都是渐近最优的,即n(θ~nθ)dN(0,I1(θ)1)

意义重大:MLE 在大样本下不仅一致,而且自动达到 CRLB。这就是 MLE 在统计学里地位如此之高的根本原因。

3.9 参数变换下的渐近性

若想估计 ϑ=g(θ),用 ϑ^n=g(θ^n),由Delta 方法

n(ϑ^nϑ)dN(0,[g(θ)]V(θ)g(θ))

并且

[g]Vg[I¯n(ϑ)]1

——同样达到 CRLB 极限。


4. 贝叶斯估计(Bayesian Estimation)

4.1 频率派 vs. 贝叶斯派

频率派(之前学的)贝叶斯派
参数 θ未知常数随机变量
出发点似然 $f(x\theta)$
推理基础"重复实验下的频率""更新主观信念"
输出点估计 + CI后验分布

4.2 故事:寻找失踪的核潜艇

1968 年 USS Scorpion 核潜艇失踪。海军专家 John Craven 把可能区域分成 n 格,让老潜艇长们先主观估计每格的概率 P(A1),,P(An)先验)。

按概率最大的区域 k 搜索,没找到。怎么办?

由 Bayes 定理:

P(Ak|Bkc)=P(Bkc|Ak)P(Ak)P(Bkc|Ak)P(Ak)+P(Bkc|Akc)P(Akc)

更新后得到新概率 P(Ak)<P(Ak)(搜索失败降低了它的可信度),其他 P(Ai) 也要重新归一化,再选最大的搜下一块。

最终在 Azores 附近找到了。这就是贝叶斯方法的实战范例

4.3 简单例子:Poisson 参数

某话务中心 5 分钟来电 XPoisson(Λ)。历史经验:

P(Λ=8)=0.25,P(Λ=10)=0.75

这是离散先验。现在观察 X=7,求后验

P(Λ=10|X=7)=P(X=7|Λ=10)0.75P(X=7|Λ=8)0.25+P(X=7|Λ=10)0.75=(0.090)(0.75)(0.140)(0.25)+(0.090)(0.75)0.659

所以 P(Λ=8|X=7)=0.341

对比:先验 P(Λ=10)=0.75 → 后验 0.659。观察 X=7(比较小)后,对"Λ 等于较大的 10"的信念减弱了,对"较小 8"的信念加强了。这正是贝叶斯更新的精髓。

4.4 后验分布的一般公式

定义:先验 π(θ)、似然 f(w|θ),则后验

g(θ|w)=f(w|θ)π(θ)f(w|θ)π(θ)dθ

口诀:后验 ∝ 似然 × 先验

分母 f(w|θ)π(θ)dθ=m(w) 称为边际似然或 evidence,仅起归一化作用。

4.5 例:Beta + Binomial(共轭!)

Max 想估计销售比例 θ

模型X|θBinomial(n,θ)

先验:基于经验,θ 大概在 0.035 附近,不超过 0.07。选 Beta 分布

π(θ)=Γ(r+s)Γ(r)Γ(s)θr1(1θ)s1

观察 X=k后验

g(θ|k)(nk)θk(1θ)nkθr1(1θ)s1=θk+r1(1θ)nk+s1const

这恰好是 Beta(k+r,nk+s) 的核!所以

θ|X=kBeta(k+r,nk+s)

共轭先验(conjugate prior):先验和后验属于同一族分布。Beta 是 Binomial 的共轭。这让计算异常简洁。 取 r=4,s=102 满足 Max 的要求:E[θ]=4/1060.038,且大部分质量在 0.07 左侧。

4.6 例:Gamma + Poisson(也是共轭!)

XiPoisson(θ) i.i.d.,W=XiPoisson(nθ)

先验:Gamma 分布

π(θ)=μsΓ(s)θs1eμθ

后验

g(θ|w)(nθ)wenθw!θs1eμθθw+s1e(μ+n)θ

Gamma(w+s,μ+n)

飓风预测案例:n=100 年里观测 w=164 次,先验取 s=88,μ=50,后验为 Gamma(252, 150)。

4.7 边际分布(Marginal)

有时候关心的不是 θ,而是 W 的"无条件分布":

m(w)=g(w,θ)dθ=f(w|θ)π(θ)dθ

:Poisson 似然 + Gamma 先验:

m(w)=01w!μsΓ(s)θw+s1e(μ+1)θdθ=Γ(w+s)w!Γ(s)(μμ+1)s(1μ+1)w

这是负二项分布!这解释了为什么"Poisson + Gamma 异质性 → 负二项"——心理学错误率、保险索赔次数等都是这种结构。

4.8 贝叶斯点估计:损失函数 + 风险

后验是个分布,怎样从中提取一个作为估计?

定义:损失函数 L(θ^,θ)0L(θ,θ)=0

风险(risk) = 损失关于后验分布的期望:

R(θ^)=Eθ|w[L(θ^,θ)]=L(θ^,θ)g(θ|w)dθ

Bayes 估计 = 使风险最小的 θ^

4.9 两个最重要的损失函数

定理

损失 L(θ^,θ)Bayes 估计
$\hat\theta - \theta
(θ^θ)2(平方损失)后验均值

平方损失证明(极简):

E(Wb)2=E[(Wμ)+(μb)]2=Var(W)+(μb)2

显然在 b=μ 时最小。所以 Bayes 估计 = 后验均值。

绝对损失证明(思路):

W 的中位数为 m

E|Wm|=m(mw)f(w)dw+m(wm)f(w)dw

利用中位数的性质 mf=mf=1/2,可以证明 E|Wm|E|Wb| 对任何 b 成立。

4.10 例:Poisson + Gamma 的 Bayes 估计

后验是 Gamma(w+s,μ+n),均值 =w+sμ+n

平方损失下 Bayes 估计:

θ^Bayes=w+sμ+n

关键观察:把它分解一下:

w+sμ+n=nμ+nwnMLE+μμ+nsμ先验均值

这是MLE 和先验均值的加权平均

  • n 大(数据多)→ 偏向 MLE
  • μ 大(先验"权威")→ 偏向先验
  • n → Bayes 估计 → MLE(数据淹没先验

这是贝叶斯方法的精髓:先验提供初始信念,数据不断更新,最终被数据"主导"。先验"假数据量"为 μ,真实数据量为 n,按比例混合。

4.11 例:Max 的库存问题(非对称损失)

Max 估计 θ^,准备 nθ^ 张盗版。

  • θ^<θ:少备货 n(θθ^) 张,每张损失 c
  • θ^>θ:多备货 n(θ^θ) 张,每张存储费 d
L(θ^,θ)={cn(θθ^)θ^<θdn(θ^θ)θ^>θ

这是非对称损失。最优 θ^ 是后验分布的某个分位点(具体是 c/(c+d) 分位点)。

意义:贝叶斯框架很灵活——你可以根据问题的实际经济损失来设计损失函数,得到针对性的最优决策。


5. 知识体系总览

                        参数估计 II
                            |
        ┌────────────┬──────┴───┬────────────────┐
        |            |          |                |
     指数族        充分性     一致性          贝叶斯估计
        |            |          |                |
   ┌────┼────┐   ┌──┼──┐   ┌──┼──┐         ┌──┼──┐
  定义 自然 各分  充分 因子 完备  依概率  Cheb./   先验 后验  Bayes
       参数 布例  统计 分解 性    收敛  Markov   ↓    ↓    估计
                  量   定理            (MLE)   π(θ) g(θ|x) (loss)
                       Basu             ↓               平方→均值
                      ✓ X̄⊥S²       渐近最优        绝对→中位数
                                    (达到CRLB)

6. 易错点与考点

误区正确认识
充分统计量唯一不!样本本身、顺序统计量都充分。最小充分才唯一(等价类)
充分 ⇒ 完备错!需要单独验证完备性
完备 ⇒ 充分错!是两个独立概念
MLE 总是最优大样本下渐近最优,小样本不一定
一致 ⇒ 无偏错!Ymax 有偏但一致
无偏 ⇒ 一致错!需要方差也要趋于 0
共轭先验是唯一选择不!只是计算方便。但任何先验都合法
Bayes 估计就是后验均值不!取决于损失函数
数据多了就不需要先验对,n 时先验被数据淹没

7. 关键公式速查表

内容公式
指数族fθ(x)=exp{η(θ)T(x)ξ(θ)}h(x)
自然形式fη(x)=exp{ηT(x)ζ(η)}h(x)
m.g.f.ψη(t)=exp{ζ(η+t)ζ(η)}
E[T]ζ/η
Var[T]2ζ/ηη=I(η)
因子分解定理fθ(x)=gθ(T(x))h(x)T 充分
完备性Eθ[f(T)]=0 θf(T)=0
Basu 定理完备充分 辅助
一致性$\lim_n P(
Chebyshev$P(
MLE 渐近n(θ^nθ)dN(0,I11)
Bayes 后验$g(\theta
平方损失 →后验均值
绝对损失 →后验中位数
Beta/Binomial$\theta
Gamma/Poisson$\theta

8. 学习路径建议

这一章理论密度高,建议按以下顺序消化:

第一遍(混个脸熟)

  1. 看懂指数族的统一形式,确认 Bernoulli/Poisson/Normal 都能套进去
  2. 理解充分性的直觉("压缩不丢信息"),背下因子分解定理
  3. 一致性 = 弱大数定律的精神
  4. 贝叶斯就是 "先验 × 似然 ∝ 后验"

第二遍(推导)

  1. 自己推一遍 Bernoulli 的指数族表达,验证 E[T]=πVar[T]=π(1π)
  2. 自己用因子分解证明 Bernoulli/Xi 充分
  3. 自己用 Chebyshev 推 X¯ 一致
  4. 自己推 Beta + Binomial → Beta 后验

第三遍(理论的味道)

  1. 完备性的"代数对偶性"——为什么"E[f(T)]=0f=0" 等价于"没有冗余"
  2. Basu 定理为什么成立的几何直觉("完备充分"和"辅助"是正交方向)
  3. MLE 渐近最优 = "大样本下达到 CRLB"
  4. Bayes 估计 = MLE + 先验加权平均(共轭情况下)

9. 与上一章的对照

上一章 (MLE/CRLB)本章 (扩展)
MLE 怎么算MLE 在大样本下渐近最优
Fisher 信息 I(θ)在指数族里 I(η)=Var(T)
CRLB 给方差下界MLE 渐近达到 CRLB
无偏性一致性(更弱但更有用)
频率派点估计贝叶斯估计(用先验)
没说"哪些数据有用"充分性告诉你"全部有用信息浓缩在 T(X)"
没强调分布的统一结构指数族给出统一框架

如果某一节还卡,告诉我具体页码或概念,我可以再展开讲。祝学习顺利!


10. 专题补充:指数族的结构化读法

指数族的一般形式可写为

f(y;η)=h(y)c(η)exp{j=1kQj(η)Tj(y)}.

更常见的自然参数形式是

f(y;η)=h(y)exp{ηT(y)A(η)}.

这里每一部分都有角色:

符号作用
h(y)与参数无关的基准测度
η自然参数
T(y)自然统计量
A(η)log normalizer,保证积分为 1

10.1 Bernoulli 例子

Bernoulli pmf 为

p(y;π)=πy(1π)1y,y=0,1.

改写:

p(y;π)=exp{ylogπ1π+log(1π)}.

因此自然参数是

η=logπ1π,

自然统计量是

T(y)=y,

log normalizer 为

A(η)=log(1+eη).

并且

Eη[T(Y)]=A(η),Varη(T(Y))=A(η).

10.2 Poisson 例子

Poisson pmf:

p(y;λ)=eλλyy!=1y!exp{ylogλλ}.

自然参数:

η=logλ.

于是

A(η)=eη,

所以

E(Y)=A(η)=eη=λ,Var(Y)=A(η)=eη=λ.

10.3 Normal 均值例子

σ2 已知,

YN(μ,σ2).

密度可写为

f(y;μ)=12πσexp{y22σ2+μσ2yμ22σ2}.

自然参数为

η=μσ2,

自然统计量为

T(y)=y.

这说明很多熟悉分布其实都共享同一套指数族结构。


11. 专题补充:充分性、因子分解与信息压缩

充分统计量回答的问题是:关于参数 θ,数据中哪些信息是必要且足够的?

11.1 因子分解定理

统计量 T(Y)θ 充分,当且仅当联合密度可写为

f(y;θ)=g(T(y),θ)h(y).

其中 h(y) 不含 θ。这表示参数相关部分只通过 T(y) 依赖数据。

11.2 Bernoulli 样本

YiBernoulli(π),

联合 pmf 为

L(π)=πyi(1π)nyi.

因此

T(Y)=i=1nYi

是充分统计量。

解释:只要知道成功次数,样本的具体排列顺序对 π 没有额外信息。

11.3 Normal 样本

YiN(μ,σ2)

且两个参数都未知,联合密度中的参数相关部分可通过

Yi,Yi2

表达,因此

T(Y)=(Yi,Yi2)

是充分统计量。

等价地,也可用

(Y¯,S2)

表达。

11.4 最小充分性的直觉

充分统计量可能不唯一。最小充分统计量是“不能再压缩而不损失参数信息”的统计量。

直觉:

  1. Y1,,Yn 包含所有原始信息;
  2. 充分统计量保留所有关于参数的信息;
  3. 最小充分统计量去掉与参数无关的冗余。

12. 专题补充:一致性、渐近正态与 MLE

12.1 一致性的检查思路

估计量 θ^n 一致表示

θ^npθ.

常用证明路线:

  1. 写出估计量;
  2. 用 LLN 说明样本均值或样本矩收敛到总体矩;
  3. 用连续映射定理得到参数函数的收敛。

方法矩估计尤其适合这个套路。

12.2 MLE 一致性的直觉

MLE 最大化样本平均 log-likelihood:

1nn(θ)=1ni=1nlogf(Yi;θ).

由 LLN,它会接近

Eθ0[logf(Y;θ)].

在可识别条件下,这个期望在真实参数 θ0 处最大,因此 MLE 会靠近 θ0

12.3 MLE 渐近正态

在正则条件下,

n(θ^θ0)dN(0,I1(θ0)1).

多参数情形为

n(θ^θ0)dNp(0,I1(θ0)1).

这条结论连接:

  1. 第 6 章 CLT;
  2. 第 7 章 Fisher 信息;
  3. 本章 MLE 渐近最优;
  4. 后续回归参数的渐近推断。

13. 专题补充:完备性、Basu 与 UMVU

13.1 完备性的含义

统计量 T 完备表示:如果

Eθ[g(T)]=0

对所有 θ 都成立,则

Pθ(g(T)=0)=1

对所有 θ 成立。

直觉是:T 的函数中不存在一个“对所有参数均值都为 0 但自身不为 0”的隐藏冗余方向。

13.2 完备充分统计量为什么重要

Lehmann-Scheffe 定理说:若 T 是完备充分统计量,且 δ(T)g(θ) 的无偏估计量,则 δ(T) 是唯一的 UMVU 估计量。

这把几个概念串起来:

概念作用
充分不丢参数信息
完备不含无用冗余
无偏目标正确
UMVU在无偏类中方差最小

13.3 Basu 定理的直觉

Basu 定理:完备充分统计量与任何辅助统计量独立。

辅助统计量的分布不依赖参数。直觉上,完备充分统计量承载全部参数信息,而辅助统计量不含参数信息,两者方向正交,因此独立。

经典例子:正态样本中,Y¯ 与标准化残差方向独立。


14. 专题补充:贝叶斯估计的计算模板

贝叶斯推断的核心公式:

π(θy)L(θ;y)π(θ).

后验 = 似然 × 先验,再归一化。

14.1 Beta-Binomial

YpBin(n,p),

先验

pBeta(α,β),

则后验为

pyBeta(α+y,β+ny).

后验均值:

E(py)=α+yα+β+n.

可以写成先验均值和样本比例的加权平均。

14.2 Gamma-Poisson

YiλPoisson(λ),

先验

λGamma(α,β)

其中 β 是 rate,则后验为

λyGamma(α+yi,β+n).

14.3 Bayes estimator

在平方损失下,Bayes 估计量是后验均值:

θ^B=E(θy).

在绝对损失下,Bayes 估计量是后验中位数。

在 0-1 损失或 MAP 思路下,常看后验众数。


15. 本章复习清单

核心内容复习时要能做到
指数族形式会识别 h(y),η,T(y),A(η)
Bernoulli 指数族会推出 logit 自然参数
Poisson 指数族会由 A(η),A(η) 得均值方差
Normal 指数族知道固定方差时自然统计量是 Y
因子分解会证明 Bernoulli 的 Yi 充分
Normal 充分统计量会写 (Yi,Yi2)
一致性会用 LLN + 连续映射证明
MLE 渐近正态能和 Fisher 信息联系
完备性能解释“无冗余”的含义
Lehmann-Scheffe知道完备充分 + 无偏推出 UMVU
Basu 定理理解完备充分与辅助统计量独立
Bayes 后验会写 posterior proportional to likelihood times prior
共轭先验会推 Beta-Binomial 和 Gamma-Poisson

16. 综合深化:共轭更新、MAP 与正则化

16.1 三个典型共轭更新

YpBin(n,p)pBeta(a,b),则

pY=yBeta(a+y,b+ny).

先验中的 a1,b1 可理解为成功与失败的伪计数,数据到来后直接累加。

Y1,,Ynλi.i.d.Poisson(λ),并采用 shape--rate 参数化 λGamma(a,b),则

λyGamma(a+iyi, b+n).

YiμN(μ,σ2)σ2 已知,且 μN(m0,s02),则后验精度与均值为

1sn2=1s02+nσ2,mn=sn2(m0s02+nY¯σ2).

后验均值是先验均值与样本均值按精度加权的结果。

16.2 Bayes 估计取决于损失函数

给定后验分布:平方损失下的 Bayes 估计是后验均值;绝对损失下是后验中位数;0--1 损失的连续近似对应后验众数,即 MAP。因而“最佳后验点估计”必须连同损失函数一起说明。

16.3 MAP 与惩罚估计

MAP 等价于最小化负对数后验:

β^MAP=argminβ{logL(β;y)logπ(β)}.

在线性高斯模型中,独立高斯先验 βjN(0,τ2) 产生 2 惩罚,即 Ridge;独立 Laplace 先验产生 1 惩罚,即 Lasso。正则化强度可解释为先验收缩强度,但频率学派中的调参和 Bayes 先验设定仍是不同的推理框架。

16.4 后验预测分布

对新观测 Ynew,应把参数不确定性积分掉:

p(ynewy)=p(ynewθ)p(θy)dθ.

只把参数替换成后验均值通常会低估预测不确定性,因为它忽略了参数后验的离散程度。

16.5 充分性与计算压缩

T(Y)θ 充分,则后验满足 p(θY)=p(θT(Y))。这说明充分统计量不仅保留频率学派推断信息,也能把 Bayes 更新压缩为低维运算;但先验与似然不共轭时,后验仍可能需要数值积分、MCMC 或变分近似。