Appearance
第 4 章:均值方差性质、顺序统计量、条件分布与矩母函数
这一章把随机变量工具进一步系统化:线性组合怎么求均值方差?样本最大值最小值怎么分布?条件分布如何定义?矩母函数如何统一刻画分布与求和?
0. 本章定位
第 3 章建立了期望、方差、联合分布和变量变换。
第 4 章把这些工具组合起来,形成后续统计推断的技术底座:
均值方差性质 -> 样本均值/样本方差
顺序统计量 -> 最大值/最小值/MLE 边界问题
条件分布 -> Bayes 与充分性
矩母函数 -> 分布识别、和的分布、CLT1. 期望的线性性
1.1 两个变量
只要期望存在,不需要独立:
1.2 多个变量
重要结论:期望的线性性不依赖独立性。
1.3 用指示变量重推二项均值
令
其中
这比直接展开二项求和更清楚。
2. 协方差与方差运算
2.1 协方差
等价形式:
2.2 独立与协方差
若
所以
但反过来不一定成立:协方差为 0 不保证独立。
2.3 线性组合方差
若
多个变量:
若两两独立:
3. 顺序统计量
3.1 定义
给定随机样本
其中
特别地:
3.2 最大值与最小值
若
最大值:
所以
最小值:
所以
3.3 第 个顺序统计量
连续情形:
直觉:有
3.4 顺序统计量为什么重要?
它连接后续多个主题:
- 样本极值的分布;
- Uniform
中 的 MLE 是 ; - 定义域含参数时,MLE 常常在边界上;
- 样本范围
的分布。
4. 条件分布与条件期望
4.1 离散条件 pmf
前提是
4.2 连续条件 pdf
前提是
4.3 条件期望
离散:
连续:
条件期望本质上是“给定信息后的平均值”。
5. 矩母函数(Moment Generating Function, MGF)
5.1 定义
随机变量
在
5.2 生成矩
若
即对
5.3 分布识别
若两个随机变量的 MGF 在 0 附近相同,则它们分布相同。
这在证明“某个和仍然服从某分布”时非常好用。
5.4 独立和的 MGF
若
例:若
6. 特征函数
特征函数定义为:
它与 MGF 类似,但优点是总是存在。渐近理论中用特征函数证明弱收敛和中心极限定理非常常见。
7. 本章知识图谱
图表渲染中…
8. 易错点与考点
| 误区 | 正确认识 |
|---|---|
| 期望线性性需要独立 | 不需要独立 |
| 方差也总是线性 | 方差有协方差项,独立时才简单相加 |
| 协方差为 0 就独立 | 一般不成立,除非有额外条件如联合正态 |
| 最大值 pdf 直接是 | |
| 条件密度忘记除以边际密度 | |
| MGF 总存在 | 不一定,特征函数才总存在 |
9. 关键公式速查表
| 内容 | 公式 |
|---|---|
| 期望线性性 | |
| 协方差 | |
| 两变量方差 | |
| 最大值 pdf | |
| 最小值 pdf | |
| 第 | |
| 条件 pmf | |
| 条件 pdf | |
| MGF | |
| 独立和 MGF |
10. 学习建议
- 用指示变量理解二项分布均值和方差。
- 顺序统计量题先写 CDF,再求导,尤其是最大值和最小值。
- 条件分布题先求边际,再相除。
- MGF 题要记住两个动作:求导得矩,乘积得独立和。
- 本章公式多,但核心只有一个:从联合结构里提取需要的边际、条件或函数分布。
11. 专题深化:线性性、协方差与方差分解
本章前半部分的目标不是再发明新的分布,而是回答一个更常见的问题:当随机变量组合在一起时,期望、方差、协方差如何变化。本章的例题通常会把这一点放在联合分布、样本和顺序统计量之前,因为后面的推断都要用它。
11.1 期望线性性的真正含义
无论
这条性质的强大之处在于:它不要求你知道
对离散型联合分布:
对连续型联合密度:
常用这一点计算样本均值:
这里不需要先求
11.2 协方差:不是“是否一起变”,而是“线性一起变”
协方差定义为
要点:
- 若
独立,则 ,所以 。 - 反过来不一定成立,协方差为 0 只表示没有线性相关。
- 协方差有单位,不方便比较;相关系数
才是标准化后的线性相关度量。
典型判断题:
| 说法 | 判断 |
|---|---|
| 独立一定不相关 | 对 |
| 不相关一定独立 | 错,一般不成立 |
| 正态联合分布中不相关可推出独立 | 对,这是正态族的特殊性质 |
| 协方差为正表示 | 错,只表示平均线性趋势 |
11.3 方差公式为什么有协方差项
从定义展开:
得到
如果
推广到
这就是为什么样本不是独立时,样本均值方差不再简单等于
11.4 用指示变量推导二项分布方差
设
若
所以
这个推导比直接对二项 pmf 求和更重要,因为它展示了“复杂计数变量 = 简单指示变量之和”的思想。后面很多期望题、抽样题、占位题都可以这样做。
12. 专题深化:顺序统计量
顺序统计量是本章的核心难点之一。给定独立同分布样本
其中
12.1 最大值:先写 CDF
最大值不超过
所以若
这类题最常见的错误是直接写“有一个等于最大值”,但连续变量“等于某个点”的概率为 0。正确路线是先处理事件,再求导。
12.2 最小值:转成补事件
最小值大于
因此
密度为
12.3 第 个顺序统计量:组合计数
事件
- 有一个观测落在
附近; - 有
个观测小于 ; - 有
个观测大于 ; - 对这些角色进行排列组合。
因此密度为
把
12.4 Uniform 顺序统计量的特殊简化
若
这说明
因此
这条结论常用于理解样本分位数:排序后的第
12.5 样本极差与联合密度
样本极差
要同时处理最小值和最大值。连续 iid 情形下,
直觉:
- 一个点落在
附近; - 一个点落在
附近; - 剩下
个点落在 ; - 排列角色数为
。
如果题目要求
13. 专题深化:条件分布与 MGF
13.1 条件分布的统一套路
无论离散还是连续,条件分布都遵循同一个结构:
离散型:
连续型:
常见步骤:
- 写出联合 pmf/pdf 的支持区域;
- 对不关心的变量求和或积分,得到边际;
- 相除;
- 重新写清条件支持。
条件支持是最容易漏的部分。例如原支持若为
13.2 条件二项与超几何
一个常见题型是:设
有
代入二项 pmf 后,
这就是超几何分布。解释是:已知总共有
13.3 MGF 的三个用途
矩母函数定义为
它有三个常用用途。
第一,求矩:
第二,识别分布。如果两个随机变量的 MGF 在 0 附近存在且相同,则它们分布相同。
第三,处理独立和。若
例如
所以
即
13.4 常见 MGF 表
| 分布 | MGF |
|---|---|
| Bernoulli | |
| Binomial | |
| Poisson | |
| Normal | |
| Exponential | |
| Gamma |
13.5 特征函数为什么出现
MGF 不一定存在,因为
其中
在本课中,特征函数主要用于理解“分布收敛”和“CLT 证明”的技术工具。考试层面通常不要求复杂计算,但要知道它比 MGF 更稳健。
14. 本章复习清单
| 核心内容 | 复习时要能做到 |
|---|---|
| 期望线性性 | 不求组合变量分布也能算期望 |
| 协方差 | 会从 |
| 方差分解 | 能判断何时可直接相加、何时要加协方差 |
| 指示变量法 | 会推导 |
| 最大值/最小值 | 会先写 CDF 再求导 |
| 第 | 会解释组合系数来源 |
| Uniform 顺序统计量 | 知道与 Beta 分布的关系 |
| 条件分布 | 会写联合、边际、条件支持 |
| 条件二项例题 | 能推出超几何分布 |
| MGF | 会求矩、识别独立和、说明存在性限制 |
| 特征函数 | 知道它总存在并服务于分布收敛 |
15. 综合深化:多维变换与“平均降低方差”
15.1 Jacobian 公式的统一视角
设
若变换不是一一映射,必须把原空间分成若干一一分支,并把各分支的密度贡献相加。忘记绝对值、支持集或多分支,是变量变换题最常见的三个错误。
若
这些公式都可通过选择辅助变量并使用二维 Jacobian 推导,不需要分别死记。
15.2 匹配信封问题:指示变量不要求独立
把
每封信放对的概率为
各
15.3 集成平均为何降低方差
设
的方差为
若预测器独立,方差降为
15.4 条件期望是均方意义下的最佳预测
对任意可测函数
第二项非负,所以
则把总变异拆成平均条件变异与条件均值变异,为回归和方差分析提供统一直觉。