Appearance
第 6 章 回归与相关分析(Regression & Correlation)
对应课件
6 Regression.pdf,覆盖 Rosner 第 11 章(与第 12.5 节 ANCOVA)。 回归是把 ANOVA 拓展到连续型自变量:研究如何随 变化。最终我们会看到 ANOVA 也只是回归的一个特例。
1. 简单线性回归(Simple Linear Regression)
1.1 研究问题
随 怎么变?正/负/无关? - 给定
,能预测 吗? 与 是否"相关"?
统计框架:
(因变量):随机变量 (自变量):当作固定的(非随机) - 关心条件期望
如何随 变
1.2 模型
三个参数:
(截距,intercept): 时直线的高度 (斜率,slope): 增加一个单位, 平均变化多少 :正相关 :负相关 :无线性关系
:残差方差,越小拟合越紧
1.3 最小二乘法(Method of Least Squares, OLS)
每个点的残差
目标:极小化残差平方和
求导可得闭式解:
性质:回归直线必经过样本均值点
。
1.4 例:孕妇雌三醇与新生儿出生体重
拟合直线:
斜率解释:雌三醇每增加 1 mg/24h,新生儿体重平均增加
预测:若
2. 回归系数的假设检验
2.1 平方和分解(Decomposition of TSS)
平方求和:
- TSS(Total):
的总变异 - RegSS(Regression):被回归直线"解释"的部分
- ResSS(Residual):未解释、剩余噪声
自由度:
均方:
2.2 F 检验
ANOVA 表(简单回归
| 来源 | SS | df | MS | F |
|---|---|---|---|---|
| 回归 | RegSS | 1 | RegSS | RegMS/ResMS |
| 残差 | ResSS | ResSS/(n-2) | – | |
| 总 | TSS | – | – |
2.3 t 检验(直接对斜率)
重要等价:在简单线性回归中,
。两种检验等价。
自由度
斜率的
3. 相关系数(Correlation)
3.1 总体相关系数
性质:
- 无量纲,
:强正线性 :强负线性 :无线性关系(注意:可能存在非线性!)
经典反例:
, 在 均匀分布, 但 完全由 决定。
3.2 Pearson 样本相关系数
与回归斜率的关系:
→ 斜率的符号与相关系数一致;斜率的大小还受
3.3 Spearman 秩相关
动机:Pearson 假设近似正态、且只能测线性关系。当数据非正态/有异常值/关系单调但非线性时,用 Spearman 更稳健。
步骤:
- 把
和 各自换成秩 、 (同值取均秩) - 对秩做 Pearson 相关:
性质:
- 测单调关系(增/减),不要求线性
- 对异常值稳健
对应秩完全同/反序
4. 拟合优度与残差分析
4.1 决定系数
: 完全无解释力 :所有点完美落在直线上 - 简单回归中
(相关系数的平方)
4.2 调整
加入更多自变量会机械地抬高
性质:
- 总有
- 加入"无用"自变量会让
下降 - 多元回归首选
来比较模型
例(雌三醇 vs 出生体重):
4.3 简单线性回归的三大假设
- 线性性(Linearity):
- 正态性(Normality):给定
, 服从正态 - 独立性(Independence):误差
之间独立
加上"等方差性"(同方差,homoscedasticity)通常合称四大假设。
4.4 残差及诊断
残差:
学生化残差(Studentized):
残差图诊断要点
| 诊断目标 | 看什么 | 异常表现 |
|---|---|---|
| 同方差 | 残差 vs | "扇形 / 漏斗" → 异方差 |
| 线性 | 残差 vs | 弯曲、U 形 → 非线性 |
| 正态 | Q-Q 图(残差 vs N(0,1) 分位数) | 系统偏离对角线 |
应对:
- 异方差 → 对
做 、 等变换 - 非线性 → 加多项式项、变换、用非线性回归
- 非正态 → 大样本下 CLT 仍可保(估计无偏);严重时用稳健方法
5. 预测(Prediction)
5.1 两种"预测"
| Case 1:群体均值 | Case 2:单个个体 | |
|---|---|---|
| 关心 | 给定 | 给定 |
| 例 | "雌三醇=15 时,平均出生体重?" | "我朋友雌三醇=15,孩子有多重?" |
| 不确定性 | 仅来自参数估计 | 参数估计 + 个体随机误差 |
预测值都是
5.2 群体均值(CI)
CI:
5.3 个体预测(PI,Prediction Interval)
注意比群体均值多了
PI:
关键直觉:估计"群体平均值"比"某一个体的值"精确得多——后者还要承担个体随机噪声
。
两种区间在
处最窄,越远离 越宽。
6. 多元线性回归(Multiple Linear Regression)
6.1 模型
6.2 偏回归系数(Partial Regression Coefficient)
与简单回归的差别:
- 简单回归
:忽略其他变量 - 多元回归
:固定其他变量 - 当变量之间相关时,两者可能差很多甚至符号相反(辛普森悖论可能出现)。
6.3 假设检验
整体 F 检验:
单系数 t 检验:
6.4 例:婴儿 SBP ~ Birthweight + Age
- 体重每增加 1 oz,SBP 平均增加 0.126 mmHg(控制日龄)
- 日龄每增加 1 天,SBP 平均增加 5.888 mmHg(控制体重)
- 预测 BWt=128, Age=3 的 SBP:
mmHg
6.5 标准化回归系数(重要性比较)
不同自变量量纲不同,直接比较
标准化系数:
含义:
简单回归特例:
等价构造:直接在标准化后的
上回归,得到的系数就是 。
6.6 共线性警告(Collinearity)
如果两自变量几乎完全相关:
- 回归系数估计不稳定,标准误膨胀
- 报告"奇怪的"符号、巨大的方差
- 软件可能直接报错
应对:
- 删除其中一个
- 主成分分析(PCA)压缩
- 岭回归 / 套索(lasso)等正则化方法
7. 哑变量(Dummy Variables):把 ANOVA 装进回归
7.1 思路
类别变量
例:
| 观测 | DrugB | DrugC |
|---|---|---|
| A | 0 | 0 |
| B | 1 | 0 |
| C | 0 | 1 |
回归模型:
系数解释:
:参照组(A)的均值 :B 与 A 的均值差 :C 与 A 的均值差
7.2 ANOVA = 含哑变量的回归
ANOVA 整体 F 检验等价于:
两两比较等价于:
| 比较 | ANOVA (LSD) | 回归 |
|---|---|---|
| j vs 参照组 | ||
| j vs h(均非参照) |
关键洞见:ANOVA 只是回归的一个特例。
7.3 例:阿司匹林退热
3 种药 A、B、C,5 名儿童一组测试 30 分钟内的退热程度
得到:
- A 组:
- B 组:
- C 组:
整体 F 检验等价于一因素 ANOVA。
8. 协方差分析(ANCOVA)
8.1 动机
比较多组(如三种药),但担心年龄等连续协变量在组间不平衡 → ANCOVA:在调整连续协变量后再比较组间差异。
8.2 模型(等斜率)
每组的回归直线斜率相同(即年龄效应一致),只是截距不同:
- 参照组:
- 第
组:
8.3 含交互的 ANCOVA(不同斜率)
加交互项
各组:
:截距 ,斜率 :截距 ,斜率 :截距 ,斜率
数值例
| 组 | 截距 | 斜率 |
|---|---|---|
| 1(参照) | 100 | 0.5 |
| 2 | 70 | 2.25 |
| 3 | 155 | -0.5 |
→ 三条不同的回归直线(不同截距和斜率)。
9. 公式速查表
| 量 | 公式 |
|---|---|
| 斜率 OLS | |
| 截距 | |
| 斜率与相关 | |
| F 检验(简单) | |
| t 检验(斜率) | |
| 群体均值 CI | |
| 个体 PI | |
| 标准化系数 |
10. 自测要点(Checklist)
简单回归
- [ ] 模型
的三个参数 - [ ] OLS 推导(最小化残差平方和、求偏导得正规方程)
- [ ] 直线必经过
- [ ] F 检验、t 检验在简单回归中的等价性
- [ ]
相关
- [ ] Pearson 相关与 Spearman 相关的差别
- [ ] 相关 = 0 不等于独立
- [ ] 相关与因果的区别
拟合度
- [ ]
与 的差别 - [ ] 何时用 Q-Q 图、何时用残差散点图
- [ ] 异方差/非线性的对应处理(变换、多项式)
预测
- [ ] CI vs PI 的方差差别(
) - [ ] 为什么
时区间最窄
多元回归
- [ ] 偏回归系数的"控制其他变量"含义
- [ ] 整体 F 与单系数 t 检验
- [ ] 标准化系数的尺度统一意义
- [ ] 共线性的危害与对策
ANOVA = 回归
- [ ]
类用 个哑变量,参照组的选择 - [ ] 截距 = 参照组均值,系数 = 与参照组的差
- [ ] LSD 检验 ↔ 哑变量回归 t 检验
ANCOVA
- [ ] 等斜率模型的 几何含义(平行线)
- [ ] 加入交互后允许不同斜率
- [ ] 何时需要 ANCOVA:组间协变量不平衡
思考题
- 一个研究发现"喝咖啡和长寿正相关",回归系数显著。这能说明咖啡延寿吗?
- 简单回归中
,但残差 vs 图呈明显 U 形,可信吗? - 多元回归中两自变量相关性很高(0.95),t 检验都不显著但 F 检验非常显著,怎么解释?
- 为什么 ANCOVA 模型默认假设各组斜率相同?检验是否能放松?
- PI 比 CI 宽,但当
时它们趋同吗?为什么?