Appearance
第 2 章:Binomial、离散与连续随机变量
这一章从“事件的概率”过渡到“随机变量的分布”。核心问题是:怎样把随机实验的结果变成数字,并描述这些数字的概率规律?
0. 本章定位
第 1 章的概率对象是事件
第 2 章开始,我们把实验结果映射成数值:
这样就可以讨论:
:离散随机变量的概率 :连续随机变量落在区间内的概率 :累积分布函数
知识链条:
事件概率 -> 随机变量 -> pdf/pmf -> cdf -> 常见分布1. 二项分布:独立重复试验的计数模型
1.1 二项模型什么时候用?
二项分布适用于:
- 固定做
次试验; - 每次只有成功/失败两个结果;
- 每次成功概率相同,为
; - 各次试验独立;
表示成功次数。
则
且
1.2 公式为什么长这样?
“恰好
- 任意一个具体序列的概率:
- 这样的序列数:
所以:
1.3 决策规则的雏形
本章中的 PM-17 药物例子已经埋下了假设检验的思想:
- 如果药真实有效,却因为样本结果不好而放弃:一种错误;
- 如果药真实无效,却因为样本结果偶然好而继续投入:另一种错误。
这就是后面第 9 章的 Type I / Type II error 的直观来源。
2. 超几何分布:不放回抽样
2.1 使用场景
一个总体中有
不放回抽取
2.2 二项 vs 超几何
| 模型 | 抽样方式 | 每次成功概率 | 典型公式 |
|---|---|---|---|
| 二项分布 | 放回或独立重复 | 不变 | |
| 超几何分布 | 不放回 | 改变 |
判断关键:是否不放回且总体有限。
3. 离散随机变量
3.1 离散概率函数
如果样本空间有限或可数无限,函数
则
对事件
3.2 离散随机变量
若
它的概率质量函数(这里也称 discrete pdf)为:
要求:
3.3 从样本点到随机变量的例子
若每天生产 3 台发电机,每台通过质检概率
如果有 2 台通过、1 台返工:
而“2 台通过、1 台返工”有
重点:随机变量会把多个样本点压缩成同一个数值,求
时要把所有对应样本点概率加起来。
4. 累积分布函数(CDF)
4.1 定义
对任意随机变量
这叫累积分布函数。
离散情形:
区间概率:
若边界是否包含有影响,要看离散点上是否有概率质量。
4.2 CDF 的用法
例:
可以写成:
CDF 的优势是把长求和变成查表或软件计算。
5. 连续随机变量
5.1 连续概率函数
连续模型不再给单点分配概率,而是给区间分配概率。
函数
则可以作为概率密度函数。
对区间:
5.2 单点概率为 0
连续随机变量满足:
所以
这和离散随机变量完全不同。
5.3 连续 CDF
如果
6. 直方图与密度
以电子管寿命为例:真实数据的直方图可以提示我们选择某个连续分布作为模型,例如指数分布:
关键理解:
- 直方图的高度不是概率本身;
- 区间面积才对应概率;
- 密度函数也是“面积为概率”。
7. 本章知识图谱
图表渲染中…
8. 易错点与考点
| 误区 | 正确认识 |
|---|---|
| 二项分布只要有成功失败就能用 | 还必须固定次数、独立、同一成功概率 |
| 不放回抽样也直接用二项 | 总体有限且不放回时一般用超几何 |
| 连续变量的 | |
| 连续变量 | 连续变量单点概率为 0 |
| 离散情形要注意边界点概率 |
9. 关键公式速查表
| 内容 | 公式 |
|---|---|
| 二项分布 | |
| 超几何分布 | |
| 离散 pmf | |
| 离散 CDF | |
| 连续 pdf 条件 | |
| 连续区间概率 | |
| 连续 CDF | |
| CDF 与 pdf |
10. 学习建议
- 先判断变量是离散还是连续。
- 离散题先列可能取值,再写
。 - 连续题先检查密度是否非负、积分是否为 1。
- 看到“不放回抽样”,优先考虑超几何分布。
- 看到“至少”“至多”,常用 CDF 或补集简化计算。
11. 二项分布例题群
11.1 磁盘驱动器例子:二项模型的四个检查点
例:信息中心有 9 个老旧磁盘,每个不可用概率 0.06。系统正常工作要求至少 7 个可用。
令
则
因为:
- 固定试验次数
; - 每个磁盘只有可用/不可用;
- 可用概率相同
; - 假设各磁盘独立。
所求概率:
这类题的关键是先定义
11.2 PM-17 药物例子:二项分布与决策错误
30 只猴子接受药物,若 16 只或更多改善就继续研发。令
若真实有效率为 0.60:
公司错误放弃有效药的概率:
若真实有效率只有 0.50:
错误继续无商业价值药物的概率:
这个例子是第 9 章假设检验的预演:
| 统计语言 | PM-17 例子 |
|---|---|
| 拒绝一个好药 | Type I / Type II 取决于如何设 |
| 继续一个差药 | 另一类错误 |
| 决策阈值 16 | 临界值 |
| 错误概率 | 显著性与功效的雏形 |
11.3 Stanley Cup 例子:不是所有二项题都直接数总成功数
七局四胜制,若两队均势,每场独立且各自胜率
系列赛在 6 场结束,表示某队前 5 场赢 3 场,并赢第 6 场。
某队在 6 场取胜的概率:
任一队在 6 场结束:
注意这里不能直接令
这类题要识别“最后一场必须是冠军赢”。
11.4 SAT 挑战例子:两个独立二项变量比较
数学组 4 人,数学成绩超过 600 的概率 0.231;阅读组 4 人,阅读超过 600 的概率 0.191。
令
数学组获胜是:
不能只算一个二项分布,需要枚举:
或展开为所有
这里用到两组独立,所以联合概率可乘。
12. 超几何分布例题群
12.1 “不放回”为什么改变模型?
二项模型的核心是每次成功概率不变。
不放回抽样时,抽到一个红球后,剩余红球数和总数都会变,下一次成功概率改变。
如果总体中有:
个红; 个白; - 总数
; - 不放回抽
个; 抽到红球个数。
则
分子含义:从红球中选
分母含义:从
12.2 Hung jury 例子
25 名潜在陪审员中,23 人会判有罪,2 人会判无罪。随机选 12 人,若无法达成一致就是 hung jury。
一致情况只有两类:
- 12 人全是有罪倾向;
- 12 人全是无罪倾向。
但只有 2 个无罪倾向者,不可能选出 12 个无罪倾向者,所以一致只能是全有罪:
因此:
也可从“至少抽到 1 个无罪倾向者”角度计算。
12.3 彩票号码例子:别被相对频率误导
Fantasy Five 从 1 到 36 中抽 5 个。若关注 1 到 12 之间的号码个数,则:
恰好 3 个号码不超过 12:
实际观察频率和理论概率不同,不一定说明彩票有偏。需要后续假设检验来判断偏差是否超过随机波动。
12.4 审计抽样例子:用补集简化尾概率
470 笔税款中有 10 笔违规,随机抽 19 笔,若发现 3 笔或更多违规就认为有问题。
令
则
所求:
直接算尾部较麻烦,使用补集:
即
“至少 3 个”这类题常优先看补集是否更短。
13. 随机变量、CDF 与连续密度例题
13.1 离散随机变量的压缩作用
随机变量不是样本点本身,而是对样本点的数值化。
同一个数值可能对应多个样本点。
发电机利润例子:
若 3 台中 2 台通过、1 台返工,则
所以:
这就是从样本空间到随机变量分布的压缩。
13.2 CDF 处理最大值
两个骰子,令
求
事件
其中
若要 pmf:
这类题说明:有些随机变量直接求 pmf 麻烦,先求 CDF 更简单。
13.3 连续密度不是概率
若
先检查:
区间概率:
虽然两个区间长度相同,但概率不同,因为密度在右侧更大。
13.4 密度缩放直方图
电子管寿命的例子说明:直方图若要和 pdf 比较,纵轴不能用频数,而要用 density。
对某个组距为
这样矩形面积才等于该区间的相对频率。
连续模型拟合数据时,要比较的是“面积形状”,不是柱子高度的原始频数。
14. 本章复习清单
- 会判断二项分布的四个条件。
- 会处理“至少/至多”的二项尾概率。
- 会识别七局四胜制这类停止规则,不机械套
。 - 会写超几何分布并解释每个组合数。
- 会用补集简化超几何尾概率。
- 会从样本点映射到随机变量取值,并合并同值样本点概率。
- 会用 CDF 求区间概率和最大值分布。
- 会检查连续 pdf 的合法性。
- 会解释为什么连续变量单点概率为 0。
- 会理解 density-scaled histogram 与 pdf 的对应关系。
15. 综合深化:从分布计算到统计决策
15.1 二项阈值规则已经包含两类错误
设新药对每个实验对象有效的概率为
决策规则是“若
它是把有效药物判为无效的错误。若药物实际只有
改变临界值 16 会在两类错误之间产生权衡:门槛提高可减少误判无效药物为有效,却增加错过有效药物的风险。第 9 章会把这种规则系统化为显著性水平、第二类错误和功效。
15.2 无放回抽样的三个模型识别例子
陪审团。 25 人中 2 人持不同意见,随机抽 12 人。恰抽到 1 人的概率为
弹道痕迹。 总共
审计抽样。 总体
三题共同结构是:总体中的“成功数”固定,抽取后剩余比例改变,因此应使用超几何分布,而不是直接套二项分布。
15.3 系列赛长度提醒我们检查 i.i.d. 假设
若两队每场胜率均为
真实比赛中,伤病、主客场、阵容调整和心理状态可能使胜率随时间改变。理论分布与经验系列赛长度不符时,不应只归咎于随机波动,还要重新检查“固定胜率、跨场独立”这两个模型假设。
15.4 连续密度的可视化尺度
直方图若要与密度曲线比较,纵轴必须使用 density,使所有柱形总面积为 1。频数直方图的高度随样本量和箱宽改变,不能直接与 pdf 数值比较。连续变量单点概率为 0,但密度值反映单位长度附近的概率集中程度。