Appearance
第 1 章 描述统计与概率(Descriptive Statistics & Probability)
对应课件
1 DescriStat & Prob.pdf,参考 Rosner《Fundamentals of Biostatistics》第 2、3 章。
0. 课程总览
生物统计学(Biostatistics)= 生物学 + 统计学,做的事情包含:数据采集 → 数据呈现/探索 → 数据分析 → 结果解释。
本课程主要内容:
- 描述性统计(Descriptive Statistics)
- 概率分布(Probability Distributions)
- 假设检验(Hypothesis Testing)
- 方差分析(ANOVA)
- 回归分析(Regression)
- 人时数据分析(Person-Time Data)
- 进阶专题与小组项目
成绩构成:平时分 20%(作业 15% + 问卷 5%)+ 期中闭卷 40% + 小组期末项目 40%。
1. 描述统计(Descriptive Statistics, Ch.2)
1.1 基本目标
设有样本
- A1:总体的集中趋势(Central Tendency)
- A2:总体的离散程度(Variability / Spread)
一句话:描述统计 = "数据长在哪里" + "数据散得多开"。
1.2 集中趋势的度量(Measures of Centrality)
1.2.1 算术平均数(Arithmetic Mean)
关键性质:
| 操作 | 新样本 | 新均值 |
|---|---|---|
| 平移: | 每个数加 | |
| 缩放: | 每个数乘 |
对异常值敏感:
- 例 1:
→ (合理) - 例 2:
→ (被 91 严重拉偏)
1.2.2 几何均值(Geometric Mean, GM)
适用于正值、偏态、乘法尺度(如增长率、稀释倍数
实际计算步骤:
- 取对数:
(log10 或 ln 均可) - 在对数尺度上算算术均值:
- 反变换:
或
直觉:把"乘法的事"变成"加法的事"再做平均,更稳健。
1.2.3 中位数(Median)
把数据从小到大排序:
为奇数:第 个值 为偶数:第 与 两个值的平均
优点:对异常值不敏感。
弱点:只用到中间的值,不反映分布两端。例如:
- 数据集 1:
- 数据集 2:
两者中位数都是 10,但分布完全不同。
1.2.4 众数(Mode)
出现频率最高的值,适合分类/离散数据。
注意事项:
- 所有值频率相同 → 没有众数
- 可能有两个或多个众数(双峰、多峰分布)
- 连续数据中众数较少使用(因为几乎无重复值)
1.2.5 偏态(Skewness)下三种度量的关系
- 右偏(正偏):长尾在右,
- 左偏(负偏):长尾在左,
- 对称:三者大致相等
记忆口诀:均值最容易被尾巴"拖走",所以哪边有长尾,均值就跑去哪边。
1.2.6 分位数(Quantiles / Percentiles)
第
= 中位数 = 下四分位数(Lower Quartile) = 上四分位数(Upper Quartile)
常见划分:
- 百分位数(percentiles):100 等分
- 十分位数(deciles):10 等分
- 四分位数(quartiles):4 等分
1.3 离散程度的度量(Measures of Variability)
1.3.1 极差(Range)
简单粗暴,但对异常值非常敏感,且随样本量
1.3.2 方差与标准差(Variance & Standard Deviation)
总体方差:
样本方差(注意分母是
样本标准差:
为什么是
是从样本估计的,样本中已经"消耗"一个自由度 - 用
才能让 (无偏估计)
为什么常用标准差而不是方差?
- 标准差与原数据单位相同,更直观
1.4 图形展示(Graphical Displays)
1.4.1 条形图 vs 直方图(Bar Graph vs Histogram)
| 条形图 Bar | 直方图 Histogram | |
|---|---|---|
| 变量类型 | 名义/有序(分类) | 连续/离散数值 |
| 横轴 | 类别 | 数值区间(bin) |
| 纵轴 | 计数/百分比 | 频数/比例 |
| 柱间是否有间隙 | 有 | 无(紧贴) |
| 例子 | 各组人数 | IQ 分数分布 |
1.4.2 案例:铅暴露对儿童神经/心理的影响
德州 El Paso 一个炼铅厂附近:
- 暴露组(GROUP=2):46 名儿童,血铅
μg/mL - 对照组(GROUP=1):78 名儿童,血铅
μg/mL - 结局变量:IQ 分数
可用条形图比较两组人数,直方图比较两组 IQ 分布。
1.4.3 箱线图(Boxplot)
五数概括 + 异常值标识:
- 下须:不超过
的最小点 - 下铰 LH(Lower Hinge)≈ 下四分位数
- 中位数线
- 上铰 UH(Upper Hinge)≈ 上四分位数
- 上须:不超过
的最大点 - 离群点:超出上述范围的点单独画出
- IQR = UH − LH(四分位距)
1.4.4 点图与散点图
- Dot Plot:组均值 + 95% 置信区间,便于组间比较
- Scatter Plot:两个变量的关系(如铅含量 vs IQ)
1.5 分组数据(Grouped Data)
为什么要分组?
- 数据量太大(WHO、CDC 报告)
- 涉及隐私/敏感信息(年龄段、薪水段)
设第
思路:把每个区间里的所有点"近似"看作中点
,再做加权平均/方差。
2. 概率(Probability, Ch.3)
2.1 概率的频率定义
抛硬币
概率 = 在"无限多次重复试验"中事件出现的相对频率。
2.2 概率空间
(样本空间):所有可能结果的集合 - 治疗结局
- 掷骰子
- 脉搏
- 治疗结局
(事件集):感兴趣的子集合,事件 (概率函数): ,满足
2.3 互斥事件(Mutually Exclusive)
若
例:掷一颗骰子,
但若
通用并集公式(容斥):
2.4 余事件(Complement)
2.5 独立事件(Independent Events)
定义:
例 1(独立):抛两枚公平硬币,两次都正面的概率
例 2(不独立):母亲与孩子的舒张压:
- 但
,故 不独立
多事件独立:
反例:
独立,各取 0/1 等概率。 (其它两个相等)三事件两两独立但不互独立。
2.6 条件概率(Conditional Probability)
例:人群筛查疾病 X
- 15% 检测阳性:
- 5% 检测阳性且确实患病:
- 阳性者真正患病的概率:
与独立性的关系:若
即"知道
2.7 相对风险(Relative Risk, RR)
设
→ 无关(独立) → 暴露增加风险 → 暴露具有保护作用
例:两医生独立诊断
:A 阳性时 B 阳性的可能性是 A 阴性时的 8 倍
2.8 全概率公式(Total Probability Rule)
若
例:60 岁以上 5 年内得白内障
| 年龄段
→ 5 年内约 5.2% 的人会得白内障。
2.9 筛查检验:灵敏度、特异度、预测值
设
| 指标 | 定义 |
|---|---|
| 灵敏度 Sensitivity | |
| 特异度 Specificity | |
| PPV(阳性预测值) | |
| NPV(阴性预测值) | |
| 假阴性 FN | |
| 假阳性 FP |
记忆:Sens / Spec 是医生能在临床上估计的(拿确诊/无病者去测);PPV/NPV 才是患者真正关心的("我测出阳性,到底是不是真有病?")。
2.10 贝叶斯公式(Bayes' Rule)
代入临床用语:
核心结论:PPV/NPV 取决于 Sens、Spec 和 患病率
。同一个检验,在不同人群里 PPV 完全不同!
2.11 例:自动血压计 vs 手动测量
- Sens = 0.84
- 假阳性率 = 0.23 → Spec = 0.77
- 患病率
→ 阳性结果不太可信,但阴性结果相当可信。
患病率的影响(同检验):
| PPV | NPV | |
|---|---|---|
| 0.01 | 0.036 | 0.998 |
| 0.20 | 0.42 | 0.96 |
| 0.90 | 0.97 | 0.348 |
关键启发:在低患病率人群(如普通人群乳腺癌筛查)大规模做高灵敏度但特异度不完美的筛查,会有大量"假阳性",PPV 很低!
2.12 患病率(Prevalence)vs 发病率(Incidence)
- 患病率 Prevalence:当前有病的人数 / 总人数(不管病了多久)
- 发病率 Incidence:原本无病的人,在指定时间窗内新发生疾病的概率
患病率是"截面照片",发病率是"动态新增"。
2.13 ROC 曲线与 AUC
ROC(Receiver Operating Characteristic)曲线:
- 横轴:1 − Specificity(假阳性率)
- 纵轴:Sensitivity(真阳性率)
- 通过改变分类阈值得到不同点 → 一条曲线
AUC(Area Under the Curve):
| AUC | 含义 |
|---|---|
| 1.0 | 完美分类 |
| 0.5 | 与随机猜测相同 |
| < 0.5 | 比随机还差(说明模型方向反了) |
为什么随机猜测 AUC = 0.5?因为此时
例(fMRI 测谎):
| Pred Lie | Pred Truth | Total | |
|---|---|---|---|
| Lie | 347 | 181 | 528 |
| Truth | 179 | 393 | 572 |
| Total | 526 | 574 | 1100 |
- Sens = 347/528 = 65.72%
- Spec = 393/572 = 68.71%
- PPV = 347/526 = 65.97%
- NPV = 393/574 = 68.47%
- 总正确率 = 740/1100 = 67.27%
- AUC = 0.7509,比随机猜测高 0.2509
3. 自测要点(Checklist)
描述统计
- [ ] 算术均值、几何均值、中位数、众数各自的定义、适用场景与对异常值的敏感度
- [ ]
自由度的来源与意义 - [ ] 偏态与三种集中趋势量的相对位置
- [ ] 条形图与直方图的区别
- [ ] 箱线图各部件的含义与离群点判定
- [ ] 分组数据均值/方差的加权公式
概率
- [ ] 互斥与独立的区别(互斥不等于独立!互斥事件如概率都为正,反而不可能独立)
- [ ] 容斥公式
- [ ] 条件概率定义与独立性等价表述
- [ ] 全概率公式
- [ ] Sens / Spec / PPV / NPV / FN / FP 的定义与公式
- [ ] 贝叶斯公式推导 PPV、NPV
- [ ] 患病率对 PPV/NPV 的影响(很重要)
- [ ] ROC、AUC 的几何含义
思考题
- 为什么药物广告中常说"无副作用",而临床数据显示"副作用率 5%",可能是怎么算出来的?(提示:分母选择)
- 一个 Sens=99%、Spec=99% 的 HIV 检测,对患病率 1/1000 的普通人群 PPV 是多少?比比直觉。
- 为什么对"罕见病"做大规模筛查通常要先考虑提高 Spec?
第 2 题答案:
! 即使灵敏度特异度都高达 99%,在罕见病人群中阳性结果的真患病概率仍然很低。