Skip to content

统计学基础:数理统计知识图谱

课程主线:概率模型 -> 随机变量 -> 分布与极限定理 -> 参数估计 -> 假设检验 -> 回归与实验设计 -> 因果推断


1. 总知识图谱

图表渲染中…


2. 章节索引

章节学习笔记核心问题
第1章概率论导论怎样用事件与概率描述随机实验?
第2章随机变量 I怎样从事件过渡到随机变量与分布?
第3章随机变量 II期望、方差、联合分布和变换如何计算?
第4章随机变量 III顺序统计量、条件分布、MGF 如何服务推断?
第5章特殊分布常见分布之间有什么生成关系?
第6章渐近理论与蒙特卡洛大样本下随机量怎样稳定和近似?
第7章参数估计如何估计未知参数并评价估计量?
第8章参数估计 II什么统计量保留信息?估计量的大样本表现如何?
第9章假设检验如何在错误概率受控下作统计决策?
第10章正态分布推断正态总体下如何做均值和方差推断?
第11章数据类型概览不同数据结构应选择什么分析方法?
第12章双样本推断两个总体的均值、方差、比例如何比较?
第13章线性回归与 Lasso如何建模多个变量与响应的关系,并做高维选择?
第14章收缩估计与方差分析如何借用组间信息,并比较多个总体均值?
第15章随机区组与非参数方法如何控制已知异质性,并在弱分布假设下推断?
第16章因果推断在什么假设下可以从关联识别因果效应?

3. 依赖关系

3.1 基础依赖

第1章 概率
  -> 第2章 随机变量
  -> 第3/4章 期望、方差、联合分布、条件分布、MGF
  -> 第5章 特殊分布

这部分是全部后续内容的语言和计算工具。

3.2 极限理论到统计推断

第6章 LLN/CLT/Slutsky/Delta
  -> 第7章 MLE、CI、CRLB
  -> 第8章 一致性、渐近最优
  -> 第9章 渐近检验

如果第 6 章不熟,后面的“近似正态”“渐近有效”“大样本检验”都会只剩结论。

3.3 正态推断链

第5章 Normal/Gamma
  -> 第10章 t、χ²、F
  -> 第12章 两样本 t、Welch、F 检验
  -> 第13章 回归中的 t/F 推断
  -> 第14章 ANOVA
  -> 第15章 随机区组与秩方法

第 10 章是第 12、13 章的直接前置。

3.4 数据分析链

第11章 数据类型判断
  -> 第12章 两样本推断
  -> 第13章 回归与Lasso
  -> 第14章 多样本 ANOVA
  -> 第15章 配对、区组与非参数方法
  -> 第16章 随机化与观察性因果推断

第 11 章决定“该用什么方法”,第 12 至 15 章展开不同数据结构下的推断,第 16 章进一步区分关联问题与因果问题。


4. 学习路线

第一轮:建立语言

  1. 第1章:事件、概率、条件概率、Bayes。
  2. 第2章:随机变量、pmf/pdf/cdf。
  3. 第3章:期望、方差、联合分布。
  4. 第4章:条件分布、顺序统计量、MGF。

目标:看到题目能把文字翻译成随机变量和分布。

第二轮:掌握常见分布与极限

  1. 第5章:把 Poisson、Normal、Gamma 等分布关系图背熟。
  2. 第6章:分清 LLN 与 CLT;掌握 Slutsky 和 Delta 方法。

目标:知道什么时候能用正态近似,什么时候能说估计量一致。

第三轮:参数估计

  1. 第7章:MLE、MoM、CI、无偏性、CRLB。
  2. 第8章:指数族、充分性、完备性、一致性、Bayes。

目标:会算估计量,也能评价估计量好不好。

第四轮:检验与应用

  1. 第9章:检验框架、p-value、错误概率、GLRT。
  2. 第10章:单样本正态推断。
  3. 第12章:双样本推断。
  4. 第13章:回归与 Lasso。
  5. 第14章:收缩估计、多样本比较与 ANOVA。
  6. 第15章:随机区组、配对设计与秩检验。
  7. 第16章:潜在结果、随机化、加权、匹配和工具变量。

目标:能根据数据结构选择检验,并正确解释结论。


5. 高频公式链

图表渲染中…


6. 方法选择速查

任务优先方法
单个正态均值,σ 已知z 区间 / z 检验
单个正态均值,σ 未知单样本 t 区间 / t 检验
单个正态方差χ2 区间 / χ2 检验
两独立正态均值,等方差pooled two-sample t
两独立正态均值,不等方差Welch t
两正态方差比较F 检验 / 方差比 CI
一个比例二项检验 / 正态近似
两个比例two-proportion z
配对数据对差值做单样本 t
多变量解释响应线性回归
高维变量选择Lasso / 正则化
分类变量关系列联表 / 独立性检验
多个独立组均值单因素 ANOVA / Welch ANOVA
多处理且有区组随机区组 ANOVA
单样本或配对的稳健位置推断Sign / Wilcoxon Signed-Rank
两独立样本的分布或位置比较Wilcoxon Rank-Sum
随机实验的平均处理效应处理组与对照组均值差 / 随机化推断
观察性研究的平均处理效应回归、IPW、AIPW、匹配
存在不依从且有有效工具IV / LATE

7. 最容易混淆的概念

概念 A概念 B区别
pdfprobabilitypdf 是密度,区间面积才是概率
independentuncorrelated独立推出不相关,反向一般不成立
LLNCLTLLN 说稳定到均值,CLT 说误差近似正态
CIhypothesis testCI 给参数范围,检验给拒绝规则;双侧情形常可互相转换
Type I errorType II error前者误拒真 H0,后者没拒假 H0
p-valueαp-value 来自数据,α 是事先设定阈值
pooledunpooled检验等比例/等方差假设时可能 pooled,CI 常不 pooled
OLSLassoOLS 无惩罚,Lasso 加 1 惩罚并产生稀疏性
associationcausation关联由联合分布描述,因果还需要设计或识别假设
ATEATT前者针对目标总体,后者针对实际处理组
randomizationignorability前者由设计保证,后者在观察性研究中依赖领域判断

8. 章节之间的依赖

下面的边表示:后一个知识点需要前一个知识点作为工具。

前置节点后续节点依赖关系
条件概率Bayes 公式P(AB) 的两种分解得到
组合计数Binomial/Hypergeometric有放回与不放回抽样的计数基础
CDF/pdf/pmf期望与方差所有矩计算都依赖分布表达
联合分布边际/条件/独立性多变量问题先从联合结构出发
期望线性性样本均值无偏不需要知道样本均值完整分布
协方差线性组合方差非独立变量不能简单相加方差
顺序统计量MLE 边界问题Uniform 上界 MLE 等于样本最大值
MGF/特征函数独立和与 CLT用乘积结构处理和的分布
PoissonExponential/Gamma计数过程与等待时间的两种视角
LLN一致性估计量稳定到真实参数
CLT大样本 CI/检验标准误与正态近似的来源
Delta 方法估计量函数θ^ 推到 g(θ^)
LikelihoodMLE/GLRT点估计和检验都可由似然构造
Fisher 信息CRLB/MLE 渐近方差信息量决定估计精度下界
指数族充分统计量自然统计量通常给出参数信息压缩
t/chi-square/F单样本与双样本推断正态样本的精确推断分布
数据类型判断方法选择先识别结构,再选 t/Welch/比例/回归
OLS线性回归推断投影、残差、方差估计、t/F 检验
高维风险Lassop>n 或变量多时需要正则化
平方损失风险James-Stein允许偏差后可用收缩降低整体 MSE
多组均值ANOVA把总变异拆成处理与误差平方和
已知异质性随机区组从误差中分离区组变异以提高功效
配对差值Signed-Rank对称但非正态时利用差值的符号与秩
潜在结果ATE/ATT用反事实定义因果效应
可忽略性与重叠回归/IPW/AIPW识别观察性研究中的反事实均值
随机鼓励IV/LATE在不依从下识别依从者局部效应

9. 从典型例题到考试题的转换表

例题类型抽象问题应先写出的对象
Monty Hall / 猎人问题条件概率条件事件、分母事件、Bayes 分解
转移球 / 分批抽样全概率按中间状态分解
磁盘故障 / 投篮次数Binomialn,p,X 的定义
不放回抽样 / 陪审团Hypergeometric总数、成功数、抽取数
最大值最小值顺序统计量P(Y(n)y)P(Y(1)>y)
产品寿命 / 保修成本Monte Carlo生成机制、事件指标、重复次数
Poisson 到达计数或等待N(t)Tk
MLE case study参数估计likelihood、log-likelihood、支持集
Binomial CI比例区间p^、标准误、置信水平
CRLB 证明估计下界score、Fisher 信息、无偏目标
z/t 检验均值检验H0,H1、检验统计量、拒绝域
Type II / power设计问题固定备择值下的接受域概率
GLRT复杂假设受限 MLE 与无受限 MLE
正态单样本方差方差推断χ2=(n1)S2/σ02
Twain/Snodgrass两样本均值独立性、等方差与否、差值参数
carbolic acid 类比例题两比例比较pooled 检验或 unpooled 区间
Advertising 数据回归Y,X,β,ε 与设计矩阵
Lasso 路径正则化损失函数、λ、KKT 条件
多种疗法/多组均值ANOVA处理平方和、误差平方和、F 比
同一受试者接受多处理随机区组区组、处理与误差三部分变异
偏态配对差值Signed-Rank绝对值秩、正负秩和、对称性
观察性治疗比较因果识别混杂、可忽略性、positivity、estimand
随机鼓励但存在不依从IV/LATE第一阶段、排除限制、单调性

10. 复习的最短闭环

每章都按同一个闭环复习:

  1. 问题是什么:估概率、估参数、检验假设、预测响应,还是选择模型。
  2. 随机对象是什么:样本空间、随机变量、样本、统计量、估计量。
  3. 分布从哪里来:精确分布、渐近分布、模拟近似,还是模型假设。
  4. 公式依赖什么条件:独立、同分布、正态、等方差、大样本、稀疏性。
  5. 结论如何解释:概率解释、置信区间解释、p-value 解释、回归系数解释。

如果一个题做错,通常可以定位到这五步中的某一步,而不是简单的“公式没背熟”。


11. 全课程高频推导链

11.1 从概率到分布

样本空间 -> 事件 -> 概率公理 -> 条件概率 -> 随机变量 -> pmf/pdf/CDF -> 期望/方差

11.2 从样本到估计

iid样本
  -> 联合密度
  -> likelihood
  -> MLE / MoM
  -> 偏差、方差、MSE
  -> Fisher信息与CRLB
  -> 一致性与渐近正态

11.3 从估计到推断

估计量分布 -> 标准误 -> pivot 或渐近 pivot -> 置信区间 -> 检验统计量 -> p-value / power

11.4 从低维到高维模型

正态均值 -> 两样本比较 -> 线性回归 -> 多参数 t/F 推断 -> 高维 OLS 风险 -> Ridge/Lasso/稀疏恢复

11.5 从实验设计到因果推断

text
多组比较 -> ANOVA -> 计划对比与多重比较
已知异质性 -> 区组化/配对 -> 更小误差方差
随机处理 -> 潜在结果均值差可识别 -> 随机化推断
观察性处理 -> 可忽略性与重叠 -> 回归/IPW/AIPW/匹配
不依从或未观测混杂 -> IV、阴性对照与敏感性分析

12. 如何使用

  1. 先读本文件,建立全课程图谱。
  2. 每章先看“知识图谱/主线”,再看“专题深化”。
  3. 复习公式时同时检查适用条件。
  4. 做例题时,把题目翻译成“随机对象 + 参数 + 分布 + 目标”。
  5. 考前用每章末尾的“本章复习清单”逐项自测。