Skip to content

第 4 章:均值方差性质、顺序统计量、条件分布与矩母函数

这一章把随机变量工具进一步系统化:线性组合怎么求均值方差?样本最大值最小值怎么分布?条件分布如何定义?矩母函数如何统一刻画分布与求和?


0. 本章定位

第 3 章建立了期望、方差、联合分布和变量变换。
第 4 章把这些工具组合起来,形成后续统计推断的技术底座:

均值方差性质 -> 样本均值/样本方差
顺序统计量 -> 最大值/最小值/MLE 边界问题
条件分布 -> Bayes 与充分性
矩母函数 -> 分布识别、和的分布、CLT

1. 期望的线性性

1.1 两个变量

只要期望存在,不需要独立:

E(aX+bY)=aE(X)+bE(Y)

1.2 多个变量

E(i=1naiWi)=i=1naiE(Wi)

重要结论:期望的线性性不依赖独立性。

1.3 用指示变量重推二项均值

X=I1++In

其中 Ii=1 表示第 i 次成功。则

E(X)=i=1nE(Ii)=np

这比直接展开二项求和更清楚。


2. 协方差与方差运算

2.1 协方差

Cov(X,Y)=E[(XEX)(YEY)]

等价形式:

Cov(X,Y)=E(XY)E(X)E(Y)

2.2 独立与协方差

X,Y 独立,则

E(XY)=E(X)E(Y)

所以

Cov(X,Y)=0

但反过来不一定成立:协方差为 0 不保证独立。

2.3 线性组合方差

Var(aX+bY)=a2Var(X)+b2Var(Y)+2abCov(X,Y)

X,Y 独立:

Var(aX+bY)=a2Var(X)+b2Var(Y)

多个变量:

Var(iaiWi)=iai2Var(Wi)+2i<jaiajCov(Wi,Wj)

若两两独立:

Var(iaiWi)=iai2Var(Wi)

3. 顺序统计量

3.1 定义

给定随机样本 Y1,,Yn,把观测值从小到大排列:

Y(1)Y(2)Y(n)

其中 Y(i) 称为第 i 个顺序统计量。

特别地:

Y(1)=Ymin,Y(n)=Ymax

3.2 最大值与最小值

Y1,,Yn i.i.d.,共同 CDF 为 F,pdf 为 f

最大值:

P(Y(n)y)=P(Y1y,,Yny)=[F(y)]n

所以

fY(n)(y)=n[F(y)]n1f(y)

最小值:

P(Y(1)>y)=P(Y1>y,,Yn>y)=[1F(y)]n

所以

fY(1)(y)=n[1F(y)]n1f(y)

3.3 第 i 个顺序统计量

连续情形:

fY(i)(y)=n!(i1)!(ni)![F(y)]i1[1F(y)]nif(y)

直觉:有 i1 个样本落在 y 左边,ni 个落在 y 右边,一个样本落在 y 附近。

3.4 顺序统计量为什么重要?

它连接后续多个主题:

  • 样本极值的分布;
  • Uniform(0,θ)θ 的 MLE 是 Y(n)
  • 定义域含参数时,MLE 常常在边界上;
  • 样本范围 Y(n)Y(1) 的分布。

4. 条件分布与条件期望

4.1 离散条件 pmf

pXY(xy)=pX,Y(x,y)pY(y)

前提是 pY(y)>0

4.2 连续条件 pdf

fXY(xy)=fX,Y(x,y)fY(y)

前提是 fY(y)>0

4.3 条件期望

离散:

E(XY=y)=xxpXY(xy)

连续:

E(XY=y)=xfXY(xy)dx

条件期望本质上是“给定信息后的平均值”。


5. 矩母函数(Moment Generating Function, MGF)

5.1 定义

随机变量 W 的矩母函数定义为:

MW(t)=E(etW)

t=0 附近存在时,它可以生成各阶矩。

5.2 生成矩

MW(t) 存在,则

E(Wr)=MW(r)(0)

即对 MW(t)r 阶导,再令 t=0

5.3 分布识别

若两个随机变量的 MGF 在 0 附近相同,则它们分布相同。

这在证明“某个和仍然服从某分布”时非常好用。

5.4 独立和的 MGF

W1,,Wn 独立,则

MiWi(t)=iMWi(t)

例:若 X1Poisson(λ1)X2Poisson(λ2) 且独立,则

X1+X2Poisson(λ1+λ2)

6. 特征函数

特征函数定义为:

φX(t)=E(eitX)

它与 MGF 类似,但优点是总是存在。渐近理论中用特征函数证明弱收敛和中心极限定理非常常见。


7. 本章知识图谱

图表渲染中…


8. 易错点与考点

误区正确认识
期望线性性需要独立不需要独立
方差也总是线性方差有协方差项,独立时才简单相加
协方差为 0 就独立一般不成立,除非有额外条件如联合正态
最大值 pdf 直接是 [F(y)]n[F(y)]n 是 CDF,pdf 要再求导
条件密度忘记除以边际密度fXY(xy)=fX,Y(x,y)fY(y)
MGF 总存在不一定,特征函数才总存在

9. 关键公式速查表

内容公式
期望线性性E(aiXi)=aiE(Xi)
协方差Cov(X,Y)=E(XY)E(X)E(Y)
两变量方差Var(aX+bY)=a2Var(X)+b2Var(Y)+2abCov(X,Y)
最大值 pdfn[F(y)]n1f(y)
最小值 pdfn[1F(y)]n1f(y)
i 顺序统计量n!(i1)!(ni)![F(y)]i1[1F(y)]nif(y)
条件 pmfpXY(xy)=pX,Y(x,y)pY(y)
条件 pdffXY(xy)=fX,Y(x,y)fY(y)
MGFMX(t)=E(etX)
独立和 MGFMXi(t)=MXi(t)

10. 学习建议

  1. 用指示变量理解二项分布均值和方差。
  2. 顺序统计量题先写 CDF,再求导,尤其是最大值和最小值。
  3. 条件分布题先求边际,再相除。
  4. MGF 题要记住两个动作:求导得矩,乘积得独立和。
  5. 本章公式多,但核心只有一个:从联合结构里提取需要的边际、条件或函数分布。

11. 专题深化:线性性、协方差与方差分解

本章前半部分的目标不是再发明新的分布,而是回答一个更常见的问题:当随机变量组合在一起时,期望、方差、协方差如何变化。本章的例题通常会把这一点放在联合分布、样本和顺序统计量之前,因为后面的推断都要用它。

11.1 期望线性性的真正含义

无论 XY 是否独立,只要期望存在,就有

E(aX+bY+c)=aE(X)+bE(Y)+c.

这条性质的强大之处在于:它不要求你知道 aX+bY 的完整分布。

对离散型联合分布:

E(aX+bY)=xy(ax+by)p(x,y)=axxpX(x)+byypY(y).

对连续型联合密度:

E(aX+bY)=(ax+by)f(x,y)dxdy=aE(X)+bE(Y).

常用这一点计算样本均值:

E(X¯)=E(1ni=1nXi)=1ni=1nE(Xi)=μ.

这里不需要先求 X¯ 的密度。

11.2 协方差:不是“是否一起变”,而是“线性一起变”

协方差定义为

Cov(X,Y)=E[(XμX)(YμY)]=E(XY)E(X)E(Y).

要点:

  1. X,Y 独立,则 E(XY)=E(X)E(Y),所以 Cov(X,Y)=0
  2. 反过来不一定成立,协方差为 0 只表示没有线性相关。
  3. 协方差有单位,不方便比较;相关系数
ρ=Cov(X,Y)σXσY

才是标准化后的线性相关度量。

典型判断题:

说法判断
独立一定不相关
不相关一定独立错,一般不成立
正态联合分布中不相关可推出独立对,这是正态族的特殊性质
协方差为正表示 Y 一定随 X 增大错,只表示平均线性趋势

11.3 方差公式为什么有协方差项

从定义展开:

Var(aX+bY)=E[(a(XμX)+b(YμY))2].

得到

Var(aX+bY)=a2Var(X)+b2Var(Y)+2abCov(X,Y).

如果 X,Y 独立,协方差项消失;如果不独立,不能简单相加。

推广到 n 个变量:

Var(i=1nXi)=i=1nVar(Xi)+2i<jCov(Xi,Xj).

这就是为什么样本不是独立时,样本均值方差不再简单等于 σ2/n

11.4 用指示变量推导二项分布方差

X=i=1nIi,Ii={1,第 i 次成功,0,否则.

Ii 独立且 P(Ii=1)=p,则

E(Ii)=p,Var(Ii)=p(1p).

所以

E(X)=np,Var(X)=np(1p).

这个推导比直接对二项 pmf 求和更重要,因为它展示了“复杂计数变量 = 简单指示变量之和”的思想。后面很多期望题、抽样题、占位题都可以这样做。


12. 专题深化:顺序统计量

顺序统计量是本章的核心难点之一。给定独立同分布样本 Y1,,Yn,排序后记为

Y(1)Y(2)Y(n).

其中 Y(1) 是最小值,Y(n) 是最大值。

12.1 最大值:先写 CDF

最大值不超过 y 等价于所有样本都不超过 y

P(Y(n)y)=P(Y1y,,Yny)=[F(y)]n.

所以若 Yi 连续且密度为 f

fY(n)(y)=n[F(y)]n1f(y).

这类题最常见的错误是直接写“有一个等于最大值”,但连续变量“等于某个点”的概率为 0。正确路线是先处理事件,再求导。

12.2 最小值:转成补事件

最小值大于 y 等价于所有样本都大于 y

P(Y(1)>y)=[1F(y)]n.

因此

P(Y(1)y)=1[1F(y)]n,

密度为

fY(1)(y)=n[1F(y)]n1f(y).

12.3 第 i 个顺序统计量:组合计数

事件 Y(i)[y,y+dy] 的直觉是:

  1. 有一个观测落在 y 附近;
  2. i1 个观测小于 y
  3. ni 个观测大于 y
  4. 对这些角色进行排列组合。

因此密度为

fY(i)(y)=n!(i1)!(ni)![F(y)]i1[1F(y)]nif(y).

i=1i=n 代入,可以回到最小值和最大值公式。

12.4 Uniform 顺序统计量的特殊简化

YiU(0,1),则 F(y)=y,f(y)=1,于是

fY(i)(y)=n!(i1)!(ni)!yi1(1y)ni,0<y<1.

这说明

Y(i)Beta(i,ni+1).

因此

E[Y(i)]=in+1.

这条结论常用于理解样本分位数:排序后的第 i 个观测大致对应总体的 i/(n+1) 分位点。

12.5 样本极差与联合密度

样本极差

R=Y(n)Y(1)

要同时处理最小值和最大值。连续 iid 情形下,(Y(1),Y(n)) 的联合密度为

fY(1),Y(n)(u,v)=n(n1)[F(v)F(u)]n2f(u)f(v),u<v.

直觉:

  1. 一个点落在 u 附近;
  2. 一个点落在 v 附近;
  3. 剩下 n2 个点落在 (u,v)
  4. 排列角色数为 n(n1)

如果题目要求 R 的分布,通常会做变量变换:r=vu,再对 u 积分。


13. 专题深化:条件分布与 MGF

13.1 条件分布的统一套路

无论离散还是连续,条件分布都遵循同一个结构:

条件=联合边际.

离散型:

pX|Y(x|y)=pX,Y(x,y)pY(y).

连续型:

fX|Y(x|y)=fX,Y(x,y)fY(y).

常见步骤:

  1. 写出联合 pmf/pdf 的支持区域;
  2. 对不关心的变量求和或积分,得到边际;
  3. 相除;
  4. 重新写清条件支持。

条件支持是最容易漏的部分。例如原支持若为 0<x<y<1,那么给定 Y=y 后,X 的支持是 0<x<y,不是 0<x<1

13.2 条件二项与超几何

一个常见题型是:设 XBin(n,p)YBin(m,p) 且独立,给定 X+Y=k,求 X 的条件分布。

P(X=xX+Y=k)=P(X=x,Y=kx)P(X+Y=k).

代入二项 pmf 后,p 的幂次会消掉,得到

P(X=xX+Y=k)=(nx)(mkx)(n+mk).

这就是超几何分布。解释是:已知总共有 k 次成功,只问这 k 次成功中有多少来自第一组,成功概率 p 不再重要。

13.3 MGF 的三个用途

矩母函数定义为

MX(t)=E(etX).

它有三个常用用途。

第一,求矩:

MX(0)=E(X),MX(0)=E(X2).

第二,识别分布。如果两个随机变量的 MGF 在 0 附近存在且相同,则它们分布相同。

第三,处理独立和。若 X,Y 独立,

MX+Y(t)=MX(t)MY(t).

例如 XiPoisson(λi) 独立,则

MXi(t)=exp{λi(et1)},

所以

MXi(t)=exp{(λi)(et1)},

XiPoisson(λi).

13.4 常见 MGF 表

分布MGF
Bernoulli(p)1p+pet
Binomial(n,p)(1p+pet)n
Poisson(λ)exp{λ(et1)}
Normal(μ,σ2)exp{μt+σ2t2/2}
Exponential(λ)λ/(λt), t<λ
Gamma(r,λ)(λ/(λt))r, t<λ

13.5 特征函数为什么出现

MGF 不一定存在,因为 E(etX) 可能发散。特征函数定义为

ϕX(t)=E(eitX),

其中 i2=1。由于 |eitX|=1,特征函数总存在。

在本课中,特征函数主要用于理解“分布收敛”和“CLT 证明”的技术工具。考试层面通常不要求复杂计算,但要知道它比 MGF 更稳健。


14. 本章复习清单

核心内容复习时要能做到
期望线性性不求组合变量分布也能算期望
协方差会从 E(XY)E(X)E(Y) 计算
方差分解能判断何时可直接相加、何时要加协方差
指示变量法会推导 Bin(n,p) 的均值和方差
最大值/最小值会先写 CDF 再求导
i 顺序统计量会解释组合系数来源
Uniform 顺序统计量知道与 Beta 分布的关系
条件分布会写联合、边际、条件支持
条件二项例题能推出超几何分布
MGF会求矩、识别独立和、说明存在性限制
特征函数知道它总存在并服务于分布收敛

15. 综合深化:多维变换与“平均降低方差”

15.1 Jacobian 公式的统一视角

(U,V)=T(X,Y) 是一一可微变换,逆变换为 (X,Y)=T1(U,V)。则

fU,V(u,v)=fX,Y(x(u,v),y(u,v))|det(x,y)(u,v)|.

若变换不是一一映射,必须把原空间分成若干一一分支,并把各分支的密度贡献相加。忘记绝对值、支持集或多分支,是变量变换题最常见的三个错误。

X,Y 独立,则和、积、商分别有

fX+Y(s)=fX(x)fY(sx)dx,fXY(u)=fX(x)fY(u/x)dx|x|,fX/Y(v)=|y|fX(vy)fY(y)dy.

这些公式都可通过选择辅助变量并使用二维 Jacobian 推导,不需要分别死记。

15.2 匹配信封问题:指示变量不要求独立

n 封信随机放入 n 个信封,令 Ii 表示第 i 封信放入正确信封,总正确数

N=i=1nIi.

每封信放对的概率为 1/n,所以

E(N)=iE(Ii)=n1n=1.

Ii 并不独立,但期望线性性仍成立。这种技巧能绕开复杂的排列分布。

15.3 集成平均为何降低方差

m 个预测器方差都为 σ2,任意两个预测器相关系数为 ρ。平均预测

T¯=1mj=1mTj

的方差为

Var(T¯)=σ2[ρ+1ρm].

若预测器独立,方差降为 σ2/m;若高度相关,增加预测器数量的收益有限。因此随机森林不仅要平均很多树,还要通过样本和特征随机化降低树之间的相关性。

15.4 条件期望是均方意义下的最佳预测

对任意可测函数 g(Y)

E{[Xg(Y)]2}=E{[XE(XY)]2}+E{[E(XY)g(Y)]2}.

第二项非负,所以 E(XY) 是用 Y 预测 X 的最优函数。全方差公式

Var(X)=E[Var(XY)]+Var[E(XY)]

则把总变异拆成平均条件变异与条件均值变异,为回归和方差分析提供统一直觉。