Appearance
生物统计学笔记(复旦 2026 春)(期中前)
基于课件 PDF 整理的系统化讲义。每章依照"概念 → 公式 → 推导 → 例题 → 自测要点"的结构展开。 前 3 章打基础,后 4 章是各种应用扩展。
目录
| 章节 | 主题 | 对应课件 | Rosner 章节 | 文件 |
|---|---|---|---|---|
| 第 1 章 | 描述统计与概率 | 1 DescriStat & Prob.pdf | Ch.2, 3 | 第1章_描述统计与概率.md |
| 第 2 章 | 概率分布(二项、泊松、正态) | 2 Prob Distributions.pdf | Ch.4, 5 | 第2章_概率分布.md |
| 第 3 章 | 估计与单样本检验 | 3 Estimation & 1-Sample Test.pdf | Ch.6, 7 | 第3章_估计与单样本检验.md |
| 第 4 章 | 双样本检验(配对/独立 t) | 4 2-Sample Test.pdf | Ch.8 | 第4章_双样本检验.md |
| 第 5 章 | 多样本推断(ANOVA) | 5 Multisample inference.pdf | Ch.12 | 第5章_多样本推断.md |
| 第 6 章 | 回归与相关 | 6 Regression.pdf | Ch.11, 12.5 | 第6章_回归分析.md |
| 第 7 章 | 人时数据与生存分析 | 7 Person-Time Data.pdf | Ch.14 | 第7章_人时数据.md |
学习路径
一、基础(第 1–3 章)
构建"统计推断"的整套语言:从用样本描述总体(描述统计),到给参数加上不确定性(估计),到判断"是不是"(假设检验)。
关键能力:
- 算均值、方差、CI
- 看懂 z 表、t 表、χ² 表、F 表
- 理解
、 、Power 的关系 - 会做单样本检验(z、t、χ²、二项)
二、扩展(第 4–5 章)
把"单样本"扩到"两样本"再到"多样本"。
关键能力:
- 区分配对与独立数据
- 选择合适的 t 检验(pooled / Welch)
- 理解 ANOVA 的"组间 vs 组内"分解
- 多重比较修正(Bonferroni)
三、模型化(第 6 章)
把检验方法统一到回归框架下:ANOVA 也只是带哑变量的回归。
关键能力:
- OLS 推导
- 残差诊断(线性、同方差、正态)
- 多元回归与偏回归系数
- ANCOVA:在调整协变量后比较组别
四、流行病学/临床(第 7 章)
引入"时间"维度,处理删失数据。
关键能力:
- 发病率、人时计算
- IRR 估计与 CI
- KM 曲线、Log-rank 检验
- Cox 比例风险模型
- 生存研究的样本量设计
知识地图(依赖关系)
┌──────────────────┐
│ 第1章 描述统计 │
│ + 概率 │
└────────┬─────────┘
│
┌────────▼─────────┐
│ 第2章 概率分布 │
│ 二项/泊松/正态 │
└────────┬─────────┘
│
┌────────▼─────────┐
│ 第3章 估计 + │
│ 单样本检验 │
└─┬───────────┬────┘
│ │
┌─────────────▼──┐ ┌───▼──────────┐
│ 第4章 双样本 │ │ 第7章 人时 │
│ t/F 检验 │ │ 生存分析 │
└────────┬───────┘ └──────────────┘
│
┌────────▼───────┐
│ 第5章 ANOVA │
│ 多组 + 多重比较│
└────────┬───────┘
│
┌────────▼───────┐
│ 第6章 回归 │
│ ANCOVA = 回归 │
└────────────────┘统一观点:z 检验是已知 σ 的 t 检验;t 检验是
的 ANOVA;ANOVA 是带哑变量的回归;ANCOVA 是带连续协变量的回归。它们都是同一棵树上的果子。
速查表:检验方法选择
| 数据类型 | 单样本 | 两样本独立 | 两样本配对 | 多样本 |
|---|---|---|---|---|
| 连续型,σ 已知 | z 检验 | 双样本 z | – | – |
| 连续型,σ 未知 | 单样本 t | Pooled / Welch t | Paired t | One-way ANOVA |
| 方差 | χ² 检验 | F 检验 | – | Bartlett |
| 比例(二项) | z(正态近似)/ 精确二项 | z / Fisher 精确 | McNemar | χ² / Cochran-Mantel-Haenszel |
| 发病率(泊松) | χ²/ 精确泊松 | IRR / 二项 | – | 分层 IRR |
| 生存数据 | – | Log-rank | Stratified log-rank | Cox 回归 |
| 关系建模 | – | 简单回归 | – | 多元回归 / Cox |
备考小贴士
- 公式不要死记,记结构:所有 CI 都是 "估计 ± 临界值 × SE" 的样子。
- 检验三种等价做法:CI 法 / 临界值法 / p 值法——任选一种就够。
- 第一类错误 vs 第二类错误:α、β 此消彼长;想都降只能 ↑n。
- 统计显著 ≠ 临床显著:大样本下小差异也会显著;小样本下大差异未必显著。
- 一图胜千言:直方图、箱线图、QQ 图、KM 曲线,看图比看数字快。
- R 实操:每章建议用 R 做一个例子。
t.test()、anova()、lm()、survival::survfit()、coxph()是高频工具。
参考
- 教材:Bernard Rosner, Fundamentals of Biostatistics, 8th Edition (2016, Cengage Learning)
- 课件:Jingru Zhang,复旦大学
- R 包推荐:
stats(基础)、car(方差检验)、survival(生存分析)、survminer(生存可视化)、ggplot2(图形)
学习这门课的最大收获:拿到一份数据集时,能从"目标 → 数据类型 → 假设条件"反推到"应该用哪种方法"。 工具是死的,思路是活的。