Appearance
统计学基础:数理统计知识图谱
课程主线:概率模型 -> 随机变量 -> 分布与极限定理 -> 参数估计 -> 假设检验 -> 回归与实验设计 -> 因果推断。
1. 总知识图谱
图表渲染中…
2. 章节索引
| 章节 | 学习笔记 | 核心问题 |
|---|---|---|
| 第1章 | 概率论导论 | 怎样用事件与概率描述随机实验? |
| 第2章 | 随机变量 I | 怎样从事件过渡到随机变量与分布? |
| 第3章 | 随机变量 II | 期望、方差、联合分布和变换如何计算? |
| 第4章 | 随机变量 III | 顺序统计量、条件分布、MGF 如何服务推断? |
| 第5章 | 特殊分布 | 常见分布之间有什么生成关系? |
| 第6章 | 渐近理论与蒙特卡洛 | 大样本下随机量怎样稳定和近似? |
| 第7章 | 参数估计 | 如何估计未知参数并评价估计量? |
| 第8章 | 参数估计 II | 什么统计量保留信息?估计量的大样本表现如何? |
| 第9章 | 假设检验 | 如何在错误概率受控下作统计决策? |
| 第10章 | 正态分布推断 | 正态总体下如何做均值和方差推断? |
| 第11章 | 数据类型概览 | 不同数据结构应选择什么分析方法? |
| 第12章 | 双样本推断 | 两个总体的均值、方差、比例如何比较? |
| 第13章 | 线性回归与 Lasso | 如何建模多个变量与响应的关系,并做高维选择? |
| 第14章 | 收缩估计与方差分析 | 如何借用组间信息,并比较多个总体均值? |
| 第15章 | 随机区组与非参数方法 | 如何控制已知异质性,并在弱分布假设下推断? |
| 第16章 | 因果推断 | 在什么假设下可以从关联识别因果效应? |
3. 依赖关系
3.1 基础依赖
第1章 概率
-> 第2章 随机变量
-> 第3/4章 期望、方差、联合分布、条件分布、MGF
-> 第5章 特殊分布这部分是全部后续内容的语言和计算工具。
3.2 极限理论到统计推断
第6章 LLN/CLT/Slutsky/Delta
-> 第7章 MLE、CI、CRLB
-> 第8章 一致性、渐近最优
-> 第9章 渐近检验如果第 6 章不熟,后面的“近似正态”“渐近有效”“大样本检验”都会只剩结论。
3.3 正态推断链
第5章 Normal/Gamma
-> 第10章 t、χ²、F
-> 第12章 两样本 t、Welch、F 检验
-> 第13章 回归中的 t/F 推断
-> 第14章 ANOVA
-> 第15章 随机区组与秩方法第 10 章是第 12、13 章的直接前置。
3.4 数据分析链
第11章 数据类型判断
-> 第12章 两样本推断
-> 第13章 回归与Lasso
-> 第14章 多样本 ANOVA
-> 第15章 配对、区组与非参数方法
-> 第16章 随机化与观察性因果推断第 11 章决定“该用什么方法”,第 12 至 15 章展开不同数据结构下的推断,第 16 章进一步区分关联问题与因果问题。
4. 学习路线
第一轮:建立语言
- 第1章:事件、概率、条件概率、Bayes。
- 第2章:随机变量、pmf/pdf/cdf。
- 第3章:期望、方差、联合分布。
- 第4章:条件分布、顺序统计量、MGF。
目标:看到题目能把文字翻译成随机变量和分布。
第二轮:掌握常见分布与极限
- 第5章:把 Poisson、Normal、Gamma 等分布关系图背熟。
- 第6章:分清 LLN 与 CLT;掌握 Slutsky 和 Delta 方法。
目标:知道什么时候能用正态近似,什么时候能说估计量一致。
第三轮:参数估计
- 第7章:MLE、MoM、CI、无偏性、CRLB。
- 第8章:指数族、充分性、完备性、一致性、Bayes。
目标:会算估计量,也能评价估计量好不好。
第四轮:检验与应用
- 第9章:检验框架、p-value、错误概率、GLRT。
- 第10章:单样本正态推断。
- 第12章:双样本推断。
- 第13章:回归与 Lasso。
- 第14章:收缩估计、多样本比较与 ANOVA。
- 第15章:随机区组、配对设计与秩检验。
- 第16章:潜在结果、随机化、加权、匹配和工具变量。
目标:能根据数据结构选择检验,并正确解释结论。
5. 高频公式链
图表渲染中…
6. 方法选择速查
| 任务 | 优先方法 |
|---|---|
| 单个正态均值, | z 区间 / z 检验 |
| 单个正态均值, | 单样本 t 区间 / t 检验 |
| 单个正态方差 | |
| 两独立正态均值,等方差 | pooled two-sample t |
| 两独立正态均值,不等方差 | Welch t |
| 两正态方差比较 | F 检验 / 方差比 CI |
| 一个比例 | 二项检验 / 正态近似 |
| 两个比例 | two-proportion z |
| 配对数据 | 对差值做单样本 t |
| 多变量解释响应 | 线性回归 |
| 高维变量选择 | Lasso / 正则化 |
| 分类变量关系 | 列联表 / 独立性检验 |
| 多个独立组均值 | 单因素 ANOVA / Welch ANOVA |
| 多处理且有区组 | 随机区组 ANOVA |
| 单样本或配对的稳健位置推断 | Sign / Wilcoxon Signed-Rank |
| 两独立样本的分布或位置比较 | Wilcoxon Rank-Sum |
| 随机实验的平均处理效应 | 处理组与对照组均值差 / 随机化推断 |
| 观察性研究的平均处理效应 | 回归、IPW、AIPW、匹配 |
| 存在不依从且有有效工具 | IV / LATE |
7. 最容易混淆的概念
| 概念 A | 概念 B | 区别 |
|---|---|---|
| probability | pdf 是密度,区间面积才是概率 | |
| independent | uncorrelated | 独立推出不相关,反向一般不成立 |
| LLN | CLT | LLN 说稳定到均值,CLT 说误差近似正态 |
| CI | hypothesis test | CI 给参数范围,检验给拒绝规则;双侧情形常可互相转换 |
| Type I error | Type II error | 前者误拒真 |
| p-value | p-value 来自数据, | |
| pooled | unpooled | 检验等比例/等方差假设时可能 pooled,CI 常不 pooled |
| OLS | Lasso | OLS 无惩罚,Lasso 加 |
| association | causation | 关联由联合分布描述,因果还需要设计或识别假设 |
| ATE | ATT | 前者针对目标总体,后者针对实际处理组 |
| randomization | ignorability | 前者由设计保证,后者在观察性研究中依赖领域判断 |
8. 章节之间的依赖
下面的边表示:后一个知识点需要前一个知识点作为工具。
| 前置节点 | 后续节点 | 依赖关系 |
|---|---|---|
| 条件概率 | Bayes 公式 | 由 |
| 组合计数 | Binomial/Hypergeometric | 有放回与不放回抽样的计数基础 |
| CDF/pdf/pmf | 期望与方差 | 所有矩计算都依赖分布表达 |
| 联合分布 | 边际/条件/独立性 | 多变量问题先从联合结构出发 |
| 期望线性性 | 样本均值无偏 | 不需要知道样本均值完整分布 |
| 协方差 | 线性组合方差 | 非独立变量不能简单相加方差 |
| 顺序统计量 | MLE 边界问题 | Uniform 上界 MLE 等于样本最大值 |
| MGF/特征函数 | 独立和与 CLT | 用乘积结构处理和的分布 |
| Poisson | Exponential/Gamma | 计数过程与等待时间的两种视角 |
| LLN | 一致性 | 估计量稳定到真实参数 |
| CLT | 大样本 CI/检验 | 标准误与正态近似的来源 |
| Delta 方法 | 估计量函数 | 从 |
| Likelihood | MLE/GLRT | 点估计和检验都可由似然构造 |
| Fisher 信息 | CRLB/MLE 渐近方差 | 信息量决定估计精度下界 |
| 指数族 | 充分统计量 | 自然统计量通常给出参数信息压缩 |
| t/chi-square/F | 单样本与双样本推断 | 正态样本的精确推断分布 |
| 数据类型判断 | 方法选择 | 先识别结构,再选 t/Welch/比例/回归 |
| OLS | 线性回归推断 | 投影、残差、方差估计、t/F 检验 |
| 高维风险 | Lasso | |
| 平方损失风险 | James-Stein | 允许偏差后可用收缩降低整体 MSE |
| 多组均值 | ANOVA | 把总变异拆成处理与误差平方和 |
| 已知异质性 | 随机区组 | 从误差中分离区组变异以提高功效 |
| 配对差值 | Signed-Rank | 对称但非正态时利用差值的符号与秩 |
| 潜在结果 | ATE/ATT | 用反事实定义因果效应 |
| 可忽略性与重叠 | 回归/IPW/AIPW | 识别观察性研究中的反事实均值 |
| 随机鼓励 | IV/LATE | 在不依从下识别依从者局部效应 |
9. 从典型例题到考试题的转换表
| 例题类型 | 抽象问题 | 应先写出的对象 |
|---|---|---|
| Monty Hall / 猎人问题 | 条件概率 | 条件事件、分母事件、Bayes 分解 |
| 转移球 / 分批抽样 | 全概率 | 按中间状态分解 |
| 磁盘故障 / 投篮次数 | Binomial | |
| 不放回抽样 / 陪审团 | Hypergeometric | 总数、成功数、抽取数 |
| 最大值最小值 | 顺序统计量 | |
| 产品寿命 / 保修成本 | Monte Carlo | 生成机制、事件指标、重复次数 |
| Poisson 到达 | 计数或等待 | |
| MLE case study | 参数估计 | likelihood、log-likelihood、支持集 |
| Binomial CI | 比例区间 | |
| CRLB 证明 | 估计下界 | score、Fisher 信息、无偏目标 |
| z/t 检验 | 均值检验 | |
| Type II / power | 设计问题 | 固定备择值下的接受域概率 |
| GLRT | 复杂假设 | 受限 MLE 与无受限 MLE |
| 正态单样本方差 | 方差推断 | |
| Twain/Snodgrass | 两样本均值 | 独立性、等方差与否、差值参数 |
| carbolic acid 类比例题 | 两比例比较 | pooled 检验或 unpooled 区间 |
| Advertising 数据 | 回归 | |
| Lasso 路径 | 正则化 | 损失函数、 |
| 多种疗法/多组均值 | ANOVA | 处理平方和、误差平方和、F 比 |
| 同一受试者接受多处理 | 随机区组 | 区组、处理与误差三部分变异 |
| 偏态配对差值 | Signed-Rank | 绝对值秩、正负秩和、对称性 |
| 观察性治疗比较 | 因果识别 | 混杂、可忽略性、positivity、estimand |
| 随机鼓励但存在不依从 | IV/LATE | 第一阶段、排除限制、单调性 |
10. 复习的最短闭环
每章都按同一个闭环复习:
- 问题是什么:估概率、估参数、检验假设、预测响应,还是选择模型。
- 随机对象是什么:样本空间、随机变量、样本、统计量、估计量。
- 分布从哪里来:精确分布、渐近分布、模拟近似,还是模型假设。
- 公式依赖什么条件:独立、同分布、正态、等方差、大样本、稀疏性。
- 结论如何解释:概率解释、置信区间解释、p-value 解释、回归系数解释。
如果一个题做错,通常可以定位到这五步中的某一步,而不是简单的“公式没背熟”。
11. 全课程高频推导链
11.1 从概率到分布
样本空间 -> 事件 -> 概率公理 -> 条件概率 -> 随机变量 -> pmf/pdf/CDF -> 期望/方差11.2 从样本到估计
iid样本
-> 联合密度
-> likelihood
-> MLE / MoM
-> 偏差、方差、MSE
-> Fisher信息与CRLB
-> 一致性与渐近正态11.3 从估计到推断
估计量分布 -> 标准误 -> pivot 或渐近 pivot -> 置信区间 -> 检验统计量 -> p-value / power11.4 从低维到高维模型
正态均值 -> 两样本比较 -> 线性回归 -> 多参数 t/F 推断 -> 高维 OLS 风险 -> Ridge/Lasso/稀疏恢复11.5 从实验设计到因果推断
text
多组比较 -> ANOVA -> 计划对比与多重比较
已知异质性 -> 区组化/配对 -> 更小误差方差
随机处理 -> 潜在结果均值差可识别 -> 随机化推断
观察性处理 -> 可忽略性与重叠 -> 回归/IPW/AIPW/匹配
不依从或未观测混杂 -> IV、阴性对照与敏感性分析12. 如何使用
- 先读本文件,建立全课程图谱。
- 每章先看“知识图谱/主线”,再看“专题深化”。
- 复习公式时同时检查适用条件。
- 做例题时,把题目翻译成“随机对象 + 参数 + 分布 + 目标”。
- 考前用每章末尾的“本章复习清单”逐项自测。