Skip to content

第 1 章 描述统计与概率(Descriptive Statistics & Probability)

对应课件 1 DescriStat & Prob.pdf,参考 Rosner《Fundamentals of Biostatistics》第 2、3 章。


0. 课程总览

生物统计学(Biostatistics)= 生物学 + 统计学,做的事情包含:数据采集 → 数据呈现/探索 → 数据分析 → 结果解释。

本课程主要内容:

  1. 描述性统计(Descriptive Statistics)
  2. 概率分布(Probability Distributions)
  3. 假设检验(Hypothesis Testing)
  4. 方差分析(ANOVA)
  5. 回归分析(Regression)
  6. 人时数据分析(Person-Time Data)
  7. 进阶专题与小组项目

成绩构成:平时分 20%(作业 15% + 问卷 5%)+ 期中闭卷 40% + 小组期末项目 40%。


1. 描述统计(Descriptive Statistics, Ch.2)

1.1 基本目标

设有样本 x1,x2,,xn,来自总体 P。我们想从样本推断:

  • A1:总体的集中趋势(Central Tendency)
  • A2:总体的离散程度(Variability / Spread)

一句话:描述统计 = "数据长在哪里" + "数据散得多开"。


1.2 集中趋势的度量(Measures of Centrality)

1.2.1 算术平均数(Arithmetic Mean)

x¯=1ni=1nxi

x¯ 是总体均值 μ 的估计。

关键性质

操作新样本新均值
平移:yi=xi+c每个数加 cy¯=x¯+c
缩放:yi=cxi每个数乘 cy¯=cx¯

对异常值敏感

  • 例 1:{6,7,5}x¯=6(合理)
  • 例 2:{1,6,2,91}x¯=25(被 91 严重拉偏)

1.2.2 几何均值(Geometric Mean, GM)

GM=(i=1nxi)1/n=x1x2xnn

适用于正值、偏态、乘法尺度(如增长率、稀释倍数 2kc)。

实际计算步骤:

  1. 取对数:logxi(log10 或 ln 均可)
  2. 在对数尺度上算算术均值:logx=1nlogxi
  3. 反变换:GM=10log10xelnx

直觉:把"乘法的事"变成"加法的事"再做平均,更稳健。


1.2.3 中位数(Median)

把数据从小到大排序:

  • n 为奇数:第 (n+1)/2 个值
  • n 为偶数:第 n/2n/2+1 两个值的平均

优点:对异常值不敏感。

弱点:只用到中间的值,不反映分布两端。例如:

  • 数据集 1:1,3,8,10,12,15,18
  • 数据集 2:1,3,4,10,100,500,1000

两者中位数都是 10,但分布完全不同。


1.2.4 众数(Mode)

出现频率最高的值,适合分类/离散数据。

注意事项:

  • 所有值频率相同 → 没有众数
  • 可能有两个或多个众数(双峰、多峰分布)
  • 连续数据中众数较少使用(因为几乎无重复值)

1.2.5 偏态(Skewness)下三种度量的关系

  • 右偏(正偏):长尾在右,Mode<Median<Mean
  • 左偏(负偏):长尾在左,Mean<Median<Mode
  • 对称:三者大致相等

记忆口诀:均值最容易被尾巴"拖走",所以哪边有长尾,均值就跑去哪边。


1.2.6 分位数(Quantiles / Percentiles)

p 百分位数 Vp 满足:

P(xVp)=p
  • V0.5 = 中位数
  • V0.25 = 下四分位数(Lower Quartile)
  • V0.75 = 上四分位数(Upper Quartile)

常见划分:

  • 百分位数(percentiles):100 等分
  • 十分位数(deciles):10 等分
  • 四分位数(quartiles):4 等分

1.3 离散程度的度量(Measures of Variability)

1.3.1 极差(Range)

Range=max(xi)min(xi)

简单粗暴,但对异常值非常敏感,且随样本量 n 增大而增大(因为更可能取到极端值)。


1.3.2 方差与标准差(Variance & Standard Deviation)

总体方差:

σ2=E[(Xiμ)2]

样本方差(注意分母是 n1):

S2=i=1n(xix¯)2n1

样本标准差:

S=S2

为什么是 n1 而不是 n

  • x¯ 是从样本估计的,样本中已经"消耗"一个自由度
  • n1 才能让 E[S2]=σ2(无偏估计)

为什么常用标准差而不是方差?

  • 标准差与原数据单位相同,更直观

1.4 图形展示(Graphical Displays)

1.4.1 条形图 vs 直方图(Bar Graph vs Histogram)

条形图 Bar直方图 Histogram
变量类型名义/有序(分类)连续/离散数值
横轴类别数值区间(bin)
纵轴计数/百分比频数/比例
柱间是否有间隙无(紧贴)
例子各组人数IQ 分数分布

1.4.2 案例:铅暴露对儿童神经/心理的影响

德州 El Paso 一个炼铅厂附近:

  • 暴露组(GROUP=2):46 名儿童,血铅 40 μg/mL
  • 对照组(GROUP=1):78 名儿童,血铅 <40 μg/mL
  • 结局变量:IQ 分数

可用条形图比较两组人数,直方图比较两组 IQ 分布。

1.4.3 箱线图(Boxplot)

五数概括 + 异常值标识:

  • 下须:不超过 LH1.5×IQR 的最小点
  • 下铰 LH(Lower Hinge)≈ 下四分位数
  • 中位数线
  • 上铰 UH(Upper Hinge)≈ 上四分位数
  • 上须:不超过 UH+1.5×IQR 的最大点
  • 离群点:超出上述范围的点单独画出
  • IQR = UH − LH(四分位距)

1.4.4 点图与散点图

  • Dot Plot:组均值 + 95% 置信区间,便于组间比较
  • Scatter Plot:两个变量的关系(如铅含量 vs IQ)

1.5 分组数据(Grouped Data)

为什么要分组?

  1. 数据量太大(WHO、CDC 报告)
  2. 涉及隐私/敏感信息(年龄段、薪水段)

设第 i 组的中点为 mi、频数为 fi

x¯=fimifi,s2=fi(mix¯)2fi

思路:把每个区间里的所有点"近似"看作中点 mi,再做加权平均/方差。


2. 概率(Probability, Ch.3)

2.1 概率的频率定义

抛硬币 n 次,正面比例随 n 趋于一个 [0,1] 之间的常数 p,称为单次抛掷正面的概率。

概率 = 在"无限多次重复试验"中事件出现的相对频率。


2.2 概率空间 (Ω,F,P)

  • Ω(样本空间):所有可能结果的集合
    • 治疗结局 {Survive,Die}
    • 掷骰子 {1,2,3,4,5,6}
    • 脉搏 [0,+)
  • F(事件集):感兴趣的子集合,事件 EΩ
  • P(概率函数)F[0,1],满足 0P(E)1

2.3 互斥事件(Mutually Exclusive)

AB=,则

P(AB)=P(A)+P(B)

例:掷一颗骰子,A={1},B={5}P(AB)=1/6+1/6=1/3

但若 A={1,3},C={1,4}AC={1},所以不能直接相加:

P(AC)=P({1,3,4})=3/6=1/2P(A)+P(C)=2/3

通用并集公式(容斥)

P(AB)=P(A)+P(B)P(AB)

2.4 余事件(Complement)

P(A¯)=1P(A)

2.5 独立事件(Independent Events)

定义:

P(AB)=P(A)P(B)A,B 独立

例 1(独立):抛两枚公平硬币,两次都正面的概率 =1/2×1/2=1/4

例 2(不独立):母亲与孩子的舒张压:

  • A={母 DBP95},B={孩 DBP80}
  • P(A)=0.1,P(B)=0.2,P(AB)=0.05
  • P(A)P(B)=0.020.05,故 不独立

多事件独立P(A1Ak)=P(Ai)互独立;只对每对都满足称两两独立

反例:X1,X2,X3 独立,各取 0/1 等概率。Ai={Xj=Xk}(其它两个相等)三事件两两独立但互独立。


2.6 条件概率(Conditional Probability)

P(AB)=P(AB)P(B),P(B)>0

:人群筛查疾病 X

  • 15% 检测阳性:P(B)=0.15
  • 5% 检测阳性且确实患病:P(AB)=0.05
  • 阳性者真正患病的概率:P(A|B)=0.05/0.15=1/3

与独立性的关系:若 A,B 独立,

P(B|A)=P(A)P(B)P(A)=P(B)

即"知道 A 发生不影响 B 的概率"。


2.7 相对风险(Relative Risk, RR)

A={吸烟},B={患肺癌}

RR=P(BA)P(BA¯)
  • RR=1 → 无关(独立)
  • RR>1 → 暴露增加风险
  • RR<1 → 暴露具有保护作用

:两医生独立诊断

  • P(A+)=0.1,P(B+)=0.17,P(A+B+)=0.08
  • P(B+|A+)=0.08/0.1=0.8
  • P(A)=0.9,P(B+A)=0.170.08=0.09
  • P(B+|A)=0.09/0.9=0.1
  • RR=0.8/0.1=8:A 阳性时 B 阳性的可能性是 A 阴性时的 8 倍

2.8 全概率公式(Total Probability Rule)

A1,,Ak 互斥且穷尽(必有一个发生),则:

P(B)=i=1kP(BAi)P(Ai)

:60 岁以上 5 年内得白内障

| 年龄段 Ai | P(Ai) | P(B|Ai) | |---|---|---| | 60–64 | 0.45 | 0.024 | | 65–69 | 0.28 | 0.046 | | 70–74 | 0.20 | 0.088 | | 75+ | 0.07 | 0.153 |

P(B)=0.0240.45+0.0460.28+0.0880.20+0.1530.070.052

→ 5 年内约 5.2% 的人会得白内障。


2.9 筛查检验:灵敏度、特异度、预测值

A={Test+},B={有病}

指标定义
灵敏度 SensitivityP(AB) = 真阳性率
特异度 SpecificityP(A¯B¯) = 真阴性率
PPV(阳性预测值)P(BA)
NPV(阴性预测值)P(B¯A¯)
假阴性 FNP(A¯B)=1Sensitivity
假阳性 FPP(AB¯)=1Specificity

记忆:Sens / Spec 是医生能在临床上估计的(拿确诊/无病者去测);PPV/NPV 才是患者真正关心的("我测出阳性,到底是不是真有病?")。


2.10 贝叶斯公式(Bayes' Rule)

P(BA)=P(AB)P(B)P(AB)P(B)+P(AB¯)P(B¯)

代入临床用语:

PPV=SensP(disease)SensP(disease)+(1Spec)P(no disease)NPV=SpecP(no disease)SpecP(no disease)+(1Sens)P(disease)

核心结论:PPV/NPV 取决于 Sens、Spec 患病率 P(disease)。同一个检验,在不同人群里 PPV 完全不同!


2.11 例:自动血压计 vs 手动测量

  • Sens = 0.84
  • 假阳性率 = 0.23 → Spec = 0.77
  • 患病率 P(disease)=0.20
PPV=0.840.20.840.2+0.230.80.42NPV=0.770.80.770.8+0.160.20.96

→ 阳性结果不太可信,但阴性结果相当可信。

患病率的影响(同检验):

P(disease)PPVNPV
0.010.0360.998
0.200.420.96
0.900.970.348

关键启发:在低患病率人群(如普通人群乳腺癌筛查)大规模做高灵敏度但特异度不完美的筛查,会有大量"假阳性",PPV 很低!


2.12 患病率(Prevalence)vs 发病率(Incidence)

  • 患病率 Prevalence:当前有病的人数 / 总人数(不管病了多久)
  • 发病率 Incidence:原本无病的人,在指定时间窗内新发生疾病的概率

患病率是"截面照片",发病率是"动态新增"。


2.13 ROC 曲线与 AUC

ROC(Receiver Operating Characteristic)曲线:

  • 横轴:1 − Specificity(假阳性率)
  • 纵轴:Sensitivity(真阳性率)
  • 通过改变分类阈值得到不同点 → 一条曲线

AUC(Area Under the Curve)

AUC含义
1.0完美分类
0.5与随机猜测相同
< 0.5比随机还差(说明模型方向反了)

为什么随机猜测 AUC = 0.5?因为此时 Sens=1Spec,ROC 退化为对角线 y=x

例(fMRI 测谎):

Pred LiePred TruthTotal
Lie347181528
Truth179393572
Total5265741100
  • Sens = 347/528 = 65.72%
  • Spec = 393/572 = 68.71%
  • PPV = 347/526 = 65.97%
  • NPV = 393/574 = 68.47%
  • 总正确率 = 740/1100 = 67.27%
  • AUC = 0.7509,比随机猜测高 0.2509

3. 自测要点(Checklist)

描述统计

  • [ ] 算术均值、几何均值、中位数、众数各自的定义、适用场景与对异常值的敏感度
  • [ ] n1 自由度的来源与意义
  • [ ] 偏态与三种集中趋势量的相对位置
  • [ ] 条形图与直方图的区别
  • [ ] 箱线图各部件的含义与离群点判定 ±1.5×IQR
  • [ ] 分组数据均值/方差的加权公式

概率

  • [ ] 互斥与独立的区别(互斥不等于独立!互斥事件如概率都为正,反而不可能独立)
  • [ ] 容斥公式 P(AB)=P(A)+P(B)P(AB)
  • [ ] 条件概率定义与独立性等价表述
  • [ ] 全概率公式
  • [ ] Sens / Spec / PPV / NPV / FN / FP 的定义与公式
  • [ ] 贝叶斯公式推导 PPV、NPV
  • [ ] 患病率对 PPV/NPV 的影响(很重要)
  • [ ] ROC、AUC 的几何含义

思考题

  1. 为什么药物广告中常说"无副作用",而临床数据显示"副作用率 5%",可能是怎么算出来的?(提示:分母选择)
  2. 一个 Sens=99%、Spec=99% 的 HIV 检测,对患病率 1/1000 的普通人群 PPV 是多少?比比直觉。
  3. 为什么对"罕见病"做大规模筛查通常要先考虑提高 Spec

第 2 题答案:PPV=0.99×0.0010.99×0.001+0.01×0.9999%! 即使灵敏度特异度都高达 99%,在罕见病人群中阳性结果的真患病概率仍然很低。