Skip to content

第 5 章:Poisson、Normal、Geometric、Negative Binomial、Gamma

这一章整理最常用的离散与连续分布。学习重点是理解它们之间的生成关系:二项极限得到 Poisson,Poisson 过程等待时间得到 Exponential/Gamma,独立正态线性组合仍是正态。


0. 本章总览

离散分布:
Bernoulli -> Binomial -> Poisson 极限
                         |
                         -> 事件计数模型

Geometric -> Negative Binomial
首次成功等待   第 r 次成功等待

连续分布:
Poisson 过程等待时间 -> Exponential -> Gamma
Binomial/样本和极限   -> Normal

1. Poisson 分布

1.1 Poisson 极限定理

XnBinomial(n,pn),n, pn0, npnλ

P(Xn=k)eλλkk!

这解释了 Poisson 分布为什么适合“次数多、单次概率小”的稀有事件计数。

1.2 定义

P(X=k)=eλλkk!,k=0,1,2,

XPoisson(λ)

其中

E(X)=λ,Var(X)=λ

1.3 典型使用场景

  • 单位时间内电话呼入数;
  • 某区域内缺陷点个数;
  • 单位面积内污染粒子数;
  • 稀有疾病发生数;
  • 火山喷发、事故、故障等事件计数。

Poisson 模型常隐含:

  1. 事件以稳定平均速率发生;
  2. 不相交区间内事件数独立;
  3. 极短区间内发生两个及以上事件概率可忽略。

2. Exponential 分布:Poisson 事件的等待时间

若 Poisson 事件以速率 λ 发生,令 Y 为相邻两次事件之间的等待时间,则

YExponential(λ)

密度为:

fY(y)=λeλy,y>0

分布函数:

FY(y)=1eλy

均值与方差:

E(Y)=1λ,Var(Y)=1λ2

核心性质:无记忆性。

P(Y>s+tY>s)=P(Y>t)

3. Normal 分布

3.1 定义

fY(y)=12πσexp[12(yμσ)2]

YN(μ,σ2)

其中 μ 控制位置,σ 控制尺度。

标准化:

Z=YμσN(0,1)

3.2 正态分布的重要性

正态分布重要有两层原因:

  1. 很多实际测量误差可近似为正态;
  2. 中心极限定理告诉我们,大量独立小随机误差之和近似正态。

3.3 二项分布的正态极限

XBinomial(n,p),当 n 大时:

Xnpnp(1p)N(0,1)

3.4 独立正态的线性组合

Y1,Y2 独立,且

YiN(μi,σi2)

Y1+Y2N(μ1+μ2,σ12+σ22)

更一般地:

iaiYiN(iaiμi, iai2σi2)

4. 中心极限定理(CLT)

W1,,Wn i.i.d.,且

E(Wi)=μ,Var(Wi)=σ2<

W¯μσ/ndN(0,1)

等价地:

W¯N(μ,σ2n)

这是后续置信区间、假设检验和渐近推断的基础。


5. Geometric 分布

5.1 定义

重复独立 Bernoulli 试验,成功概率为 p。令 X 为第一次成功出现所需试验次数,则

P(X=k)=(1p)k1p,k=1,2,

记作:

XGeometric(p)

均值与方差:

E(X)=1p,Var(X)=1pp2

5.2 直觉

几何分布是“等待首次成功”。
失败越容易,即 p 越小,等待时间平均越长。


6. Negative Binomial 分布

6.1 定义

重复 Bernoulli 试验,成功概率为 p。令 X 为第 r 次成功出现时的试验次数,则

P(X=k)=(k1r1)pr(1p)kr,k=r,r+1,

记作负二项分布。

6.2 与几何分布的关系

几何分布是负二项分布在 r=1 时的特例。

Geometric: 等第 1 次成功
Negative Binomial: 等第 r 次成功

7. Gamma 分布

7.1 Gamma 函数

Γ(r)=0yr1eydy

递推关系:

Γ(r)=(r1)Γ(r1)

r 为正整数:

Γ(r)=(r1)!

7.2 Gamma 分布定义

fY(y)=λrΓ(r)yr1eλy,y>0

YΓ(r,λ)

其中这里采用 rate 参数 λ

均值与方差:

E(Y)=rλ,Var(Y)=rλ2

7.3 与 Poisson 过程的关系

若 Poisson 事件速率为 λ,等待第 r 个事件发生的时间服从:

Γ(r,λ)

r=1 时就是指数分布:

Γ(1,λ)=Exponential(λ)

7.4 Gamma 和的性质

UΓ(r,λ),VΓ(s,λ)

且独立,则

U+VΓ(r+s,λ)

8. 分布关系图

图表渲染中…


9. 易错点与考点

误区正确认识
Poisson 的均值和方差不同Poisson 中 E(X)=Var(X)=λ
指数分布参数 λ 是均值λ 是 rate,均值是 1/λ
Gamma 参数一定是 scale本章使用 rate 参数 λ
几何分布从 0 开始本章定义为第几次成功,取值 1,2,
负二项分布只数失败次数不同教材定义不同,本章可理解为第 r 次成功所需试验次数
正态近似二项不需要条件通常要求 npn(1p) 都不太小

10. 关键公式速查表

分布pmf/pdf均值方差
Poisson(λ)eλλk/k!λλ
Exponential(λ)λeλy1/λ1/λ2
Normal(μ,σ2)12πσe(yμ)2/(2σ2)μσ2
Geometric(p)(1p)k1p1/p(1p)/p2
Negative Binomial(r,p)(k1r1)pr(1p)krr/pr(1p)/p2
Gamma(r,λ)λryr1eλy/Γ(r)r/λr/λ2

11. 学习建议

  1. 先背“场景”,再背公式:计数、等待、测量误差分别对应不同分布。
  2. Poisson、Exponential、Gamma 要一起学,因为它们来自同一个 Poisson 过程。
  3. Normal 的重点不是密度公式,而是标准化和线性组合。
  4. 看到“第一次成功”“第 r 次成功”,立刻联想到 Geometric/Negative Binomial。
  5. 做题时先确认参数化,尤其 Gamma 的 rate/scale 不要混。

12. 专题深化:Poisson 分布与稀有事件

Poisson 分布在本章中通常不是孤立出现的。它连接了二项极限、单位时间事件数、Poisson 过程和指数等待时间。

12.1 从 Binomial 到 Poisson

XnBin(n,pn),npnλ,

则对固定的 k

P(Xn=k)=(nk)pnk(1pn)nk.

pn=λ/n,则

(nk)(λn)k=n(n1)(nk+1)k!λknkλkk!,

(1λn)neλ,(1λn)k1.

所以

P(Xn=k)eλλkk!.

直觉是:试验次数很多、单次成功概率很小、总体平均次数稳定时,计数近似 Poisson。

12.2 Poisson 模型的适用场景

Poisson 适合描述某个固定区域或时间窗口内的事件次数,例如:

场景随机变量
一小时内客服电话数计数
一页书中的印刷错误数计数
一段 DNA 上突变数计数
某路口一天事故数计数

使用 Poisson 模型时,隐含假设通常包括:

  1. 事件在不相交区间内近似独立;
  2. 单位区间内平均发生率稳定;
  3. 在极小区间内发生两个及以上事件的概率可以忽略。

12.3 Poisson 的加法性

XiPoisson(λi)

相互独立,则

i=1mXiPoisson(i=1mλi).

可以用 MGF 证明,也可以用“独立来源的事件流合并”理解。

这条性质在建模中很常见:多个部门的呼叫量、多个区域的事故数、多个时间段的到达数相加后仍是 Poisson。

12.4 条件 Poisson 变成 Binomial/Multinomial

如果 XPoisson(λ1)YPoisson(λ2) 独立,给定 X+Y=n,则

XX+Y=nBin(n,λ1λ1+λ2).

解释:总事件数已经固定为 n,每个事件来自第一类来源的概率为

λ1λ1+λ2.

多类别时会推广为 multinomial。


13. 专题深化:Poisson 过程、Exponential 与 Gamma

13.1 Poisson 过程的两个随机量

Poisson 过程可以从两个角度看:

  1. N(t):时间 t 内发生的事件数;
  2. Tk:等到第 k 个事件所需的时间。

若过程速率为 λ,则

N(t)Poisson(λt).

第一个事件等待时间 T1 满足

P(T1>t)=P(N(t)=0)=eλt.

因此

FT1(t)=1eλt,fT1(t)=λeλt.

T1Exponential(λ).

13.2 指数分布的无记忆性

指数分布有

P(T>s+tT>s)=P(T>t).

证明:

P(T>s+tT>s)=P(T>s+t)P(T>s)=eλ(s+t)eλs=eλt.

含义是:已经等了多久,不会改变还要继续等待的分布。这是连续型等待时间中非常特殊的性质。

13.3 Gamma 分布作为第 r 次到达时间

r 次事件到达时间

Tr=X1++Xr,

其中 Xi 是独立的 Exponential(λ) 间隔时间。因此

TrGamma(r,λ)

在本章的 rate 参数化下,密度为

f(t)=λrΓ(r)tr1eλt,t>0.

r 是正整数时,

Γ(r)=(r1)!.

均值和方差为

E(Tr)=rλ,Var(Tr)=rλ2.

13.4 Gamma 与卡方分布

卡方分布是 Gamma 的特殊情形:

χν2Gamma(ν2,12)

若使用 rate 参数化,则也可写作

χν2Gamma(ν2,λ=12).

后续第 10 章会用它描述正态样本方差:

(n1)S2σ2χn12.

14. 专题深化:Normal 分布与近似

14.1 标准化

如果

YN(μ,σ2),

Z=YμσN(0,1).

标准化的作用是把不同均值、不同尺度的正态变量统一转成标准正态,从而查表或使用分位数。

常见概率计算:

P(a<Y<b)=P(aμσ<Z<bμσ).

14.2 正态线性组合

Y1,,Yn 独立且

YiN(μi,σi2),

则任意线性组合仍为正态:

i=1naiYiN(aiμi,ai2σi2).

特别地,若 YiN(μ,σ2) iid,则

Y¯N(μ,σ2n).

这为第 9、10 章的 z 检验和 t 检验提供基础。

14.3 二项分布的正态近似

XBin(n,p),且 npn(1p) 都足够大时,

Xnpnp(1p)N(0,1).

如果要求 P(aXb),可以使用连续性修正:

P(aXb)P(a0.5<Y<b+0.5),

其中

YN(np,np(1p)).

连续性修正的直觉是:离散整数点 a,,b 对应连续轴上的区间 [a0.5,b+0.5]

14.4 Poisson 的正态近似

λ 较大时,

Poisson(λ)N(λ,λ).

标准化为

XλλN(0,1).

同样可使用连续性修正。


15. 专题深化:Geometric 与 Negative Binomial

15.1 Geometric:第一次成功所需试验次数

本章采用的定义是

P(Y=k)=(1p)k1p,k=1,2,

即第 k 次试验第一次成功。

因此

E(Y)=1p,Var(Y)=1pp2.

它的离散无记忆性为

P(Y>s+tY>s)=P(Y>t).

15.2 Negative Binomial:第 r 次成功所需试验次数

Y 表示第 r 次成功发生在第 k 次试验,则

P(Y=k)=(k1r1)pr(1p)kr,k=r,r+1,

解释:

  1. k 次必须成功;
  2. k1 次中恰好有 r1 次成功;
  3. 所以组合数是 (k1r1)

均值与方差:

E(Y)=rp,Var(Y)=r(1p)p2.

r=1 时,负二项分布退化为几何分布。

15.3 离散等待时间与连续等待时间的对应

过程第一次等待r 次等待
Bernoulli 试验序列GeometricNegative Binomial
Poisson 过程ExponentialGamma

16. 本章复习清单

核心内容复习时要能做到
Poisson 极限定理能从 Binomial 推到 Poisson
Poisson 建模能说明稀有、独立、稳定率假设
Poisson 加法性会用 MGF 或事件流解释
条件 Poisson能推出给定总数后的 Binomial
Poisson 过程理解 N(t) 与等待时间的双视角
Exponential会推导密度和无记忆性
Gamma知道是多个指数等待时间之和
Normal 标准化能把任意正态概率转成 Z
正态线性组合会写均值和方差
二项正态近似会判断条件并使用连续性修正
几何分布会解释第几次首次成功
负二项分布会解释组合数 (k1r1)

17. 综合深化:正态近似的使用与诊断

17.1 航空超售与连续性校正

航空公司售出 178 张票,只有 168 个座位,每位乘客独立地以概率 0.9 登机。登机人数

XBin(178,0.9),

其均值和标准差为

E(X)=160.2,Var(X)=178(0.9)(0.1)4.00.

座位足够的概率是 P(X168)。用正态近似时作连续性校正:

P(X168)Φ(168.5160.24.00)0.981.

不作 0.5 校正相当于用连续面积错误地近似离散柱形,尾部误差往往更明显。

17.2 分位数反解:顶尖百分位

若智商近似 N(100,152),进入最高 2% 需要满足

P(X>c)=0.02.

因此

c=100+15z0.98100+15(2.054)130.8.

这类题的关键是先把“前 2%”翻译为右尾概率,再确认应查 0.98 分位数而不是 0.02

17.3 小尾概率是证据,不是结论本身

已知某指标在基准人群中服从 N(μ,σ2),观测到 x 后计算

PH0(Xx)

可衡量该观测在基准模型下有多极端。但应注意:

  • 这是在 H0 成立下的数据尾概率,不是 H0 为真的概率;
  • 若从许多人中挑出最极端的一人,必须考虑选择和多重性;
  • 正态模型、均值和方差若由数据估计,零分布也会改变;
  • 统计极端不自动提供因果或身份判断。

例如单个犯罪指数很极端,可能反对“来自普通人群”的模型;但若嫌疑人从一个很大的群体中筛选而来,至少一人极端的概率会远高于单人尾概率。

17.4 二项分布的两种近似方向

  • n 大、p 不太靠近 0 或 1:用正态近似,关注中心区域与连续性校正;
  • n 大、p 很小且 np=λ 适中:用 Poisson(λ) 近似,关注稀有计数。

同一个二项模型选择哪种近似,取决于参数区域,而不是只看样本量。