Skip to content

第 2 章:Binomial、离散与连续随机变量

这一章从“事件的概率”过渡到“随机变量的分布”。核心问题是:怎样把随机实验的结果变成数字,并描述这些数字的概率规律?


0. 本章定位

第 1 章的概率对象是事件 A
第 2 章开始,我们把实验结果映射成数值:

X:SR

这样就可以讨论:

  • P(X=k):离散随机变量的概率
  • P(aXb):连续随机变量落在区间内的概率
  • FX(t)=P(Xt):累积分布函数

知识链条:

事件概率 -> 随机变量 -> pdf/pmf -> cdf -> 常见分布

1. 二项分布:独立重复试验的计数模型

1.1 二项模型什么时候用?

二项分布适用于:

  1. 固定做 n 次试验;
  2. 每次只有成功/失败两个结果;
  3. 每次成功概率相同,为 p
  4. 各次试验独立;
  5. X 表示成功次数。

XBinomial(n,p)

P(X=k)=(nk)pk(1p)nk,k=0,1,,n

1.2 公式为什么长这样?

“恰好 k 次成功”由两部分组成:

  • 任意一个具体序列的概率:pk(1p)nk
  • 这样的序列数:(nk)

所以:

P(X=k)=(nk)安排成功位置pk(1p)nk某一序列的概率

1.3 决策规则的雏形

本章中的 PM-17 药物例子已经埋下了假设检验的思想:

  • 如果药真实有效,却因为样本结果不好而放弃:一种错误;
  • 如果药真实无效,却因为样本结果偶然好而继续投入:另一种错误。

这就是后面第 9 章的 Type I / Type II error 的直观来源。


2. 超几何分布:不放回抽样

2.1 使用场景

一个总体中有 N 个对象,其中 r 个是“成功类”,w=Nr 个是“失败类”。
不放回抽取 n 个,令 X 为成功类个数,则

P(X=k)=(rk)(wnk)(Nn)

2.2 二项 vs 超几何

模型抽样方式每次成功概率典型公式
二项分布放回或独立重复不变(nk)pk(1p)nk
超几何分布不放回改变(rk)(wnk)/(Nn)

判断关键:是否不放回且总体有限


3. 离散随机变量

3.1 离散概率函数

如果样本空间有限或可数无限,函数 p(s) 满足:

p(s)0,sSp(s)=1

p 是离散概率函数。

对事件 A

P(A)=sAp(s)

3.2 离散随机变量

X 的取值是有限或可数无限个实数,则 X 是离散随机变量。

它的概率质量函数(这里也称 discrete pdf)为:

pX(k)=P(X=k)

要求:

pX(k)0,kpX(k)=1

3.3 从样本点到随机变量的例子

若每天生产 3 台发电机,每台通过质检概率 0.95。通过一台赚 10000,返工一台亏 2000。令 X 为当天利润。

如果有 2 台通过、1 台返工:

X=2(10000)1(2000)=18000

而“2 台通过、1 台返工”有 (32) 种排列,所以

P(X=18000)=(32)(0.95)2(0.05)

重点:随机变量会把多个样本点压缩成同一个数值,求 P(X=k) 时要把所有对应样本点概率加起来。


4. 累积分布函数(CDF)

4.1 定义

对任意随机变量 X

FX(t)=P(Xt)

这叫累积分布函数。

离散情形:

FX(t)=ktpX(k)

区间概率:

P(a<Xb)=FX(b)FX(a)

若边界是否包含有影响,要看离散点上是否有概率质量。

4.2 CDF 的用法

例:XBinomial(50,0.6),求

P(21X40)

可以写成:

P(21X40)=FX(40)FX(20)

CDF 的优势是把长求和变成查表或软件计算。


5. 连续随机变量

5.1 连续概率函数

连续模型不再给单点分配概率,而是给区间分配概率。

函数 f(y) 若满足:

f(y)0,f(y)dy=1

则可以作为概率密度函数。

对区间:

P(aYb)=abfY(y)dy

5.2 单点概率为 0

连续随机变量满足:

P(Y=a)=0

所以

P(a<Y<b)=P(aYb)=P(a<Yb)

这和离散随机变量完全不同。

5.3 连续 CDF

FY(y)=P(Yy)=yfY(t)dt

如果 FY 可导,则

fY(y)=FY(y)

6. 直方图与密度

以电子管寿命为例:真实数据的直方图可以提示我们选择某个连续分布作为模型,例如指数分布:

f(t)=λeλt,t>0

关键理解:

  • 直方图的高度不是概率本身;
  • 区间面积才对应概率;
  • 密度函数也是“面积为概率”。

7. 本章知识图谱

图表渲染中…


8. 易错点与考点

误区正确认识
二项分布只要有成功失败就能用还必须固定次数、独立、同一成功概率
不放回抽样也直接用二项总体有限且不放回时一般用超几何
连续变量的 f(y) 是概率f(y) 是密度,面积才是概率
连续变量 P(Y=a) 可能大于 0连续变量单点概率为 0
FX(b)FX(a) 一定是 P(aXb)离散情形要注意边界点概率

9. 关键公式速查表

内容公式
二项分布P(X=k)=(nk)pk(1p)nk
超几何分布P(X=k)=(rk)(wnk)/(Nn)
离散 pmfpX(k)=P(X=k)
离散 CDFFX(t)=ktpX(k)
连续 pdf 条件f(y)0, f(y)dy=1
连续区间概率P(aYb)=abfY(y)dy
连续 CDFFY(y)=yfY(t)dt
CDF 与 pdffY(y)=FY(y)

10. 学习建议

  1. 先判断变量是离散还是连续。
  2. 离散题先列可能取值,再写 pX(k)
  3. 连续题先检查密度是否非负、积分是否为 1。
  4. 看到“不放回抽样”,优先考虑超几何分布。
  5. 看到“至少”“至多”,常用 CDF 或补集简化计算。

11. 二项分布例题群

11.1 磁盘驱动器例子:二项模型的四个检查点

例:信息中心有 9 个老旧磁盘,每个不可用概率 0.06。系统正常工作要求至少 7 个可用。

X=可用磁盘数

XBinomial(9,0.94)

因为:

  1. 固定试验次数 n=9
  2. 每个磁盘只有可用/不可用;
  3. 可用概率相同 p=0.94
  4. 假设各磁盘独立。

所求概率:

P(X7)=k=79(9k)(0.94)k(0.06)9k

这类题的关键是先定义 X。若你定义“坏掉的磁盘数”,也可以做,但阈值会变成 X2

11.2 PM-17 药物例子:二项分布与决策错误

30 只猴子接受药物,若 16 只或更多改善就继续研发。令

X=改善数量

若真实有效率为 0.60:

XBinomial(30,0.60)

公司错误放弃有效药的概率:

P(X15)=k=015(30k)(0.60)k(0.40)30k

若真实有效率只有 0.50:

XBinomial(30,0.50)

错误继续无商业价值药物的概率:

P(X16)=k=1630(30k)(0.50)30

这个例子是第 9 章假设检验的预演:

统计语言PM-17 例子
拒绝一个好药Type I / Type II 取决于如何设 H0
继续一个差药另一类错误
决策阈值 16临界值
错误概率显著性与功效的雏形

11.3 Stanley Cup 例子:不是所有二项题都直接数总成功数

七局四胜制,若两队均势,每场独立且各自胜率 0.5

系列赛在 6 场结束,表示某队前 5 场赢 3 场,并赢第 6 场。

某队在 6 场取胜的概率:

(53)(0.5)3(0.5)2(0.5)

任一队在 6 场结束:

2(53)(0.5)6

注意这里不能直接令 XBinomial(7,0.5) 然后算 P(X=4),因为系列赛一旦某队先到 4 胜就停止,后面的比赛不存在。

这类题要识别“最后一场必须是冠军赢”。

11.4 SAT 挑战例子:两个独立二项变量比较

数学组 4 人,数学成绩超过 600 的概率 0.231;阅读组 4 人,阅读超过 600 的概率 0.191。

MBinomial(4,0.231)CRBinomial(4,0.191)

数学组获胜是:

M>CR

不能只算一个二项分布,需要枚举:

P(M>CR)=c=04P(CR=c)P(M>c)

或展开为所有 (m,c) 满足 m>c 的联合概率:

m>cP(M=m)P(CR=c)

这里用到两组独立,所以联合概率可乘。


12. 超几何分布例题群

12.1 “不放回”为什么改变模型?

二项模型的核心是每次成功概率不变。
不放回抽样时,抽到一个红球后,剩余红球数和总数都会变,下一次成功概率改变。

如果总体中有:

  • r 个红;
  • w 个白;
  • 总数 N=r+w
  • 不放回抽 n 个;
  • X= 抽到红球个数。

P(X=k)=(rk)(wnk)(Nn)

分子含义:从红球中选 k 个,从白球中选 nk 个。
分母含义:从 N 个总体中任意选 n 个。

12.2 Hung jury 例子

25 名潜在陪审员中,23 人会判有罪,2 人会判无罪。随机选 12 人,若无法达成一致就是 hung jury。

一致情况只有两类:

  1. 12 人全是有罪倾向;
  2. 12 人全是无罪倾向。

但只有 2 个无罪倾向者,不可能选出 12 个无罪倾向者,所以一致只能是全有罪:

P(unanimous)=(2312)(2512)

因此:

P(hung jury)=1(2312)(2512)

也可从“至少抽到 1 个无罪倾向者”角度计算。

12.3 彩票号码例子:别被相对频率误导

Fantasy Five 从 1 到 36 中抽 5 个。若关注 1 到 12 之间的号码个数,则:

r=12,w=24,n=5,N=36

恰好 3 个号码不超过 12:

P(X=3)=(123)(242)(365)

实际观察频率和理论概率不同,不一定说明彩票有偏。需要后续假设检验来判断偏差是否超过随机波动。

12.4 审计抽样例子:用补集简化尾概率

470 笔税款中有 10 笔违规,随机抽 19 笔,若发现 3 笔或更多违规就认为有问题。

X=样本中违规笔数

XHypergeometric(N=470,r=10,n=19)

所求:

P(X3)

直接算尾部较麻烦,使用补集:

P(X3)=1P(X=0)P(X=1)P(X=2)

1k=02(10k)(46019k)(47019)

“至少 3 个”这类题常优先看补集是否更短。


13. 随机变量、CDF 与连续密度例题

13.1 离散随机变量的压缩作用

随机变量不是样本点本身,而是对样本点的数值化。
同一个数值可能对应多个样本点。

发电机利润例子:

X=10000×(通过数)2000×(返工数)

若 3 台中 2 台通过、1 台返工,则 X=18000。但对应样本序列有:

(S,S,F),(S,F,S),(F,S,S)

所以:

P(X=18000)=(32)(0.95)2(0.05)

这就是从样本空间到随机变量分布的压缩。

13.2 CDF 处理最大值

两个骰子,令 X 为较大点数。

FX(t)=P(Xt)
事件 Xt 等价于两个骰子都不超过 t

FX(t)=P(it,jt)=t6t6=t236

其中 t=1,2,,6

若要 pmf:

P(X=t)=FX(t)FX(t1)=t2(t1)236

这类题说明:有些随机变量直接求 pmf 麻烦,先求 CDF 更简单。

13.3 连续密度不是概率

f(t)=3t2,0t1

先检查:

013t2dt=1

区间概率:

P(0Y1/3)=01/33t2dt=127P(2/3Y1)=2/313t2dt=1827=1927

虽然两个区间长度相同,但概率不同,因为密度在右侧更大。

13.4 密度缩放直方图

电子管寿命的例子说明:直方图若要和 pdf 比较,纵轴不能用频数,而要用 density。

对某个组距为 h 的 bin:

density height=relative frequencyh

这样矩形面积才等于该区间的相对频率。

连续模型拟合数据时,要比较的是“面积形状”,不是柱子高度的原始频数。


14. 本章复习清单

  1. 会判断二项分布的四个条件。
  2. 会处理“至少/至多”的二项尾概率。
  3. 会识别七局四胜制这类停止规则,不机械套 P(X=4)
  4. 会写超几何分布并解释每个组合数。
  5. 会用补集简化超几何尾概率。
  6. 会从样本点映射到随机变量取值,并合并同值样本点概率。
  7. 会用 CDF 求区间概率和最大值分布。
  8. 会检查连续 pdf 的合法性。
  9. 会解释为什么连续变量单点概率为 0。
  10. 会理解 density-scaled histogram 与 pdf 的对应关系。

15. 综合深化:从分布计算到统计决策

15.1 二项阈值规则已经包含两类错误

设新药对每个实验对象有效的概率为 p,30 次独立试验中有效数

XBin(30,p).

决策规则是“若 X16 则继续研发”。若把“药物达到目标有效率”作为原假设,例如 H0:p=0.6,则错误终止的概率为

P0.6(X15),

它是把有效药物判为无效的错误。若药物实际只有 p=0.3,却因 X16 而继续研发,则错误概率为

P0.3(X16).

改变临界值 16 会在两类错误之间产生权衡:门槛提高可减少误判无效药物为有效,却增加错过有效药物的风险。第 9 章会把这种规则系统化为显著性水平、第二类错误和功效。

15.2 无放回抽样的三个模型识别例子

陪审团。 25 人中 2 人持不同意见,随机抽 12 人。恰抽到 1 人的概率为

(21)(2311)(2512).

弹道痕迹。 总共 N 个可能刻痕位置,证据子弹占 m 个位置,测试子弹占 n 个位置。若把两组位置视为随机子集,至少一个位置重合的概率可由补集计算:

P(至少一处重合)=1(Nmn)(Nn).

审计抽样。 总体 N 笔交易中有 M 笔违规,无放回审计 n 笔,发现至少 3 笔违规的概率为

1k=02(Mk)(NMnk)(Nn).

三题共同结构是:总体中的“成功数”固定,抽取后剩余比例改变,因此应使用超几何分布,而不是直接套二项分布。

15.3 系列赛长度提醒我们检查 i.i.d. 假设

若两队每场胜率均为 1/2 且各场独立,七场四胜制在第 6 场结束,要求获胜方前 5 场恰赢 3 场且第 6 场获胜。考虑任一方获胜:

P(L=6)=2(53)(12)6.

真实比赛中,伤病、主客场、阵容调整和心理状态可能使胜率随时间改变。理论分布与经验系列赛长度不符时,不应只归咎于随机波动,还要重新检查“固定胜率、跨场独立”这两个模型假设。

15.4 连续密度的可视化尺度

直方图若要与密度曲线比较,纵轴必须使用 density,使所有柱形总面积为 1。频数直方图的高度随样本量和箱宽改变,不能直接与 pdf 数值比较。连续变量单点概率为 0,但密度值反映单位长度附近的概率集中程度。